中国智能体登顶全球OSWorld榜单!90.2%刷新世界纪录!

生成式AI行业已告别参数内卷、概念营销的粗放增长期,智能体产业化落地能力,正成为资本市场评判AI企业核心价值的重要标尺。近日,全球权威computer-use智能体评测基准OSWorld更新榜单,实在

生成式AI行业已告别参数内卷、概念营销的粗放增长期,智能体产业化落地能力,正成为资本市场评判AI企业核心价值的重要标尺。近日,全球权威computer-use智能体评测基准OSWorld更新榜单,实在智能旗下实在Agent以90.2%的实景任务成功率,斩获总榜与Agentic Framework分榜双榜冠军,成为该评测发布以来首个突破90%大关的智能体。

image.png

从对话到实操,智能体赛道换挡

本次榜单迭代,凸显全球AI产业重要变化:行业竞争从通用大模型的对话能力比拼,转向可落地、可复用、可规模化的实景实操能力竞争。区别于传统对话式AI,computer-use智能体可自主操控电脑、完成多软件协同、处理复杂产业流程,实现AI从交互工具向生产力工具的升级,也是当前创投市场重点布局的核心赛道。

OSWorld由国际顶尖高校联合研发、收录于AI顶会NeurIPS,是目前全球认可度较高的智能体实景评测体系之一。该评测基于真实Ubuntu操作系统环境,覆盖办公、设计、编程、系统运维等361项实战任务,全程机器自动核验,数据客观公允,是海内外头部企业验证智能体落地能力的核心标准。

行业数据显示,人类操作基线为72.36%,此前全球行业最优成绩为83.6%。实在Agent突破90%大关,超越人工操作基准,刷新该评测公开发布以来的最高得分纪录。

image.png

两条路线,两种壁垒

当前全球智能体赛道主要分为两大技术路径:一是依托通用大模型原生推理能力,主打参数与算力优化;二是以实在智能为代表的“模型+工程体系”框架路线,凭借成熟Harness工程架构补齐大模型实操短板。本次OSWorld榜单显示,工程化框架路线整体表现更优,已成为行业头部玩家的主流选择。

随着大模型技术日趋同质化,单纯模型迭代已无法构建长期竞争壁垒,工程化落地能力、场景适配能力与产业服务积淀,成为企业拉开差距的核心关键。深耕自动化赛道八年,实在智能在产品层面依托TARS垂直大模型与ISSUT智能屏幕语义理解技术两大核心能力,形成了差异化优势。

其中,TARS垂直大模型聚焦产业数字化场景,精准适配行业业务指令与流程逻辑,有效规避通用大模型的认知偏差,贴合企业规范化作业需求;ISSUT智能屏幕语义理解技术,打破传统工具的接口、坐标依赖局限,可动态识别各类非标界面、老旧系统及信创环境,适配复杂真实工况,显著提升智能体场景容错率与兼容性。

image.png

工程底座决定落地高度

基于两大核心技术,实在智能搭建了完备的Harness工程体系,形成API优先、GUI兜底的智能执行逻辑:可优先通过API接口高效完成标准化操作,面对无接口、页面改版、非标系统等复杂场景,切换GUI像素级实操模式,实现全场景兼容。同时具备长链路任务拆解、跨软件协同、异常自愈、全流程合规校验能力,有效改善行业“演示效果好、落地不稳定”的普遍问题。目前,实在Agent已规模化落地制造业、能源、医药、跨境电商、交通航空、零售电商等多个核心行业。

针对各垂直行业特性,实在Agent可精准适配专属业务场景:助力制造业完成生产核验、自动化巡检;为能源行业提供安全运维、数据台账智能管理;满足医药行业严苛的合规资料整理需求;承接跨境与零售电商订单处理、报关流转、库存统筹等高频工作;赋能交通航空行业运维数据梳理与流程优化。截至目前,实在智能已服务超6000家客户,通过海量真实场景持续打磨,积累了成熟的异常处理与非标适配经验,形成了工程化与场景化的双重积累。

估值逻辑正在被重写

行业分析认为,AI智能体赛道估值逻辑正在发生变化。行业早期聚焦模型参数、技术迭代速度,当下更看重企业的工程化能力、场景落地能力、商业化变现能力。此次实在Agent登顶全球榜单,是其技术实力与产业服务能力的一次集中呈现。

未来,computer-use智能体将逐步覆盖海量重复性、流程化人工办公工作,成为千行百业数字化转型与组织重塑的重要生产力中枢。随着工程化能力持续提升,国产智能体有望在更多产业场景中实现规模化落地,为国内AI产业高质量发展提供可靠支撑。


(来源:投资家)
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐