打破纪录!浙产AI Agent问鼎OSWorld全球榜首,执行成功率首破90%
2026-07-29 18:03:00 世界浙商
世界浙商客户端讯(记者:胡淼、陈思宇)在人工智能从“对话”走向“行动”的关键节点,近日,一张来自全球权威基准测试OSWorld的榜单,让一家浙江企业——浙江实在智能科技有限公司(下文简称“实在智能”)引发业界的广泛关注。
OSWorld最新榜单显示,实在智能推出的“实在Agent”以90.20%的执行成功率,在智能体框架与总榜中均列第一。这是该项评测中,智能体成功率首次超过90%。业内人士认为,在OSWorld这类真实计算机环境评测中取得领先,一定程度上反映出相关技术在复杂操作任务上的工程化进展。

受访企业供图
90%分水岭:从“勉强能跑”到“靠谱能用”
这份榜单的含金量如何?
记者了解到,作为当前计算机操作领域最具权威性与区分度的基准测试之一,OSWorld覆盖超300个真实世界的电脑桌面与网页任务,采用基于执行结果的自动验证机制,要求智能体在真实系统环境中完成完整交互并生成可复现的执行轨迹。
这一评测的残酷之处在于,它要求智能体像人一样直接操作真实的图形界面,任何一步的界面理解偏差或操作失误都可能导致任务失败,几乎没有“碰运气”的空间。
联想研究院在今年3月撰文称,即便是最先进的智能体,其单次运行成绩也长期停留在67%左右。据OSWorld 官网,人类操作者的平均成功率约为72%。也就是说,人类操作者在评测条件下,平均约有72%的任务能够一次性将系统状态正确推进到预定义的目标终态。
实在Agent此次成绩明显超过这一基准线。有分析人士指出,在要求较高的企业级场景中,90%以上的成功率常被认为是技术走出实验室、走向规模化应用的一个重要参考指标。

受访企业供图
Harness工程:重新定义AI能力的天花板
实在Agent此次登顶,走的是一条与多数行业巨头不同的技术路径。
OSWorld榜单分设三条赛道——专用模型、通用模型、智能体框架。Meta、MiniMax等提交的通用模型方案,主要依靠模型自身的推理能力处理任务;实在Agent此次提交的是“通用模型+工程架构”的智能体框架方案。该公司将这套工程化能力称为“Harness工程”,其核心是复杂任务的拆解调度、自我纠错与多智能体协同。
在榜单TOP10中,有6个选择了框架路线,且整体成绩普遍高于纯通用模型方案。这指向一个行业正在形成的共识——模型是大脑,但光有大脑远远不够。Harness工程能力正在成为决定AI真实落地能力的核心变量。
换言之,如果说大模型是动力澎湃的引擎,Harness工程就是整套传动系统和控制装置。缺少这套系统,再强大的模型也只能原地轰鸣,无法平稳上路。
为什么实在智能能够构建出这样的Harness工程?答案藏在它长期深耕的B端自动化战场里。企业负责人介绍,这3年来,实在Agent在几千家企业的真实业务系统里“上班”——打通异构系统,处理权限校验、异常弹窗、界面变动等无数具体而琐碎的问题。哪些流程需要绕过,哪些异常必须捕获,哪些规则可以沉淀为可复用的组件,这些行业知识不是靠算力砸出来的,而是在无数个交付现场中一口一口啃下来的。

受访企业供图
登顶背后,是数千家企业客户的真实沉淀
公开信息显示,实在智能成立于2018年,总部位于浙江杭州,公司专注于为企业提供安全、稳定、高效的企业级智能体产品与数字化转型解决方案。
据实在智能介绍,其目前已服务超过6000家企业客户,相关智能体平台已在财务、人力、运营等部门部署。该公司负责人表示,在处理大量企业真实业务流程中积累的异常处理经验,为实在Agent在OSWorld评测中的表现提供了工程基础。
在人工智能从对话走向行动的进程中,智能体在权威基准测试中成功率突破90%,被部分业内人士视为迈向可靠执行的重要一步。实在Agent此次在OSWorld上取得的成绩,也让业界将目光投向智能体框架工程这一技术路径。
据新华社报道,今年1月,由清华大学主办的“AGI-Next”峰会上,行业专家形成共识:以对话为核心的“Chat”范式已告终结,AI竞争转向“能办事”的智能体时代。清华大学智能产业研究院创始院长张亚勤认为,人工智能正向智能体AI加速演进。智能体AI能够像人一样设定任务、规划实现路径、试错反馈,具有自主性、能举一反三和长期记忆三个特征。
当智能体执行成功率突破90%,一个“一句话完成工作”的智能办公新范式正在从想象走进现实。一家浙江智能体企业此番问鼎OSWorld全球榜首,也让世界看到:在人工智能这一全球科技竞争的制高点上,中国不仅有高原,更有勇攀高峰的力量。
