


近日,全球AI智能体权威基准OSWorld榜单刷新,榜首第一次写上了中国团队的名字。浙江实在智能自研的“实在Agent”以90.2%的任务成功率登顶全球总榜,同时斩获智能体框架分榜第一,拿下双项冠军。此前,这个榜单的最高纪录一直由Meta、Anthropic、OpenAI等硅谷巨头把持,本次成绩领先第二名6.6个百分点。
OSWorld被业界称为AI的“计算机驾照考试”。它不考对话流畅度,而是把AI直接扔进真实的电脑操作系统,让它独立完成文件编辑、表格处理、图像修改、邮件收发、跨应用协同等361项复杂任务,全程由机器自动判定结果。
据悉,2024年OSWorld刚推出时,最顶级的AI模型成功率只有12%。到2025年底,行业最好成绩提升到72.6%,2026年5月,纪录被推到83.6%,实在Agent直接把门槛抬到了90.2%。
“这个第一,是养出来的。”
“这个第一不是写出来的,是养出来的。”实在智能创始人孙林君向记者介绍,2018年创立公司时,大模型还没爆发,团队就瞄准了“数字员工”这个赛道,本质上是希望用软件机器人操作电脑,来帮人干活。
2023年,实在智能推出了国内第一个智能体产品,但真正让它在OSWorld上登顶的,不是底层大模型本身,而是一套被称作Harness的工程调度系统。实在智能用七年时间、6000家企业的真实场景,反复打磨这套系统,让AI“不掉链子”。
“任务怎么拆、工具怎么调、出错了怎么补救、上下的逻辑如何顺畅,都是这套系统在做。”孙林君说。
这套系统到底能干什么?
孙林君举了个财务报销的例子。一个职员用“实在Agent”完成了发票报销,这件事的流程可以生成一个“技能”,发布到公司的“企业大脑”上。其他同事再报销时,直接复用这个技能就行——数据是私有的,能力是共享的。
“我们提供的不只是个人智能助理,还有能够沉淀企业知识、数据和能力的企业大脑。”孙林君说。
制造业的场景更复杂。一家接单、排产、生产、交付的工厂,订单可能来自系统接口、邮件、聊天软件,格式五花八门。智能体可以把这些渠道的订单统一录入系统,再根据订单、人员、原材料情况做合理排产,缩短交付周期。“从订单到交付整个链路上,可以有很多智能体来参与。”孙林君说。
OSWorld的评测也验证了这种能力。在公认最难的三类任务中,实在Agent表现突出:跨应用协同93个任务拿下78.81分,要求智能体在多个软件间连续穿梭;图像处理26题拿下24题,成功率92.3%;系统底层操作24个任务100%满分零失误。
“90%是行业公认的关键临界点——在此之下,智能体还停留在‘勉强能跑’的实验状态;跨过这条线,才意味着迈入稳定可用、可靠落地的产业阶段。”孙林君说,下一步的目标不仅是让AI“能办事”,更要“办成事、办好事”。