


2026年9月9日,全球公认最难考的GUI定位基准ScreenSpot-Pro榜单更新。余杭企业实在智能Indeed-UI-32B,以82.7%的任务成功率,登顶全球第一。Indeed-UI-8B,以81%的成绩紧随其后,位列全球第二,同参数量级模型第一。该榜单包括GPT、Claude、Gemini、Qwen等全球最强的模型,余杭企业实在智能包揽了冠亚军。

目前,ScreenSpot-Pro已入选Hugging Face官方基准测试体系,是全行业公认的GUI Grounding能力评估标准。其测试包括整屏、高分辨率的真实专业软件截图、覆盖26款真实专业应用、覆盖Windows、macOS、Linux三大操作系统等内容,考察AI能不能像人一样,在复杂的软件界面中,精准找到并定位到该点击的按钮、菜单或输入框等。
“本次实在智能的登顶,意味着我们不仅在绝对性能上登顶,更在效率维度上展现出领先优势——以更小参数实现高精度,为企业低成本部署提供了切实可行的路径。”实在智能相关负责人介绍。
如果ScreenSpot-Pro考的是“看得准”,那OSWorld考的就是“做得完”。此前,实在智能已在OSWorld上取得全球第一。两个榜单,一个指向GUI定位,一个指向端到端任务执行,都是国际公认的权威评测。接下来,Indeed-UI系列模型将持续迭代优化,在图标定位、复杂嵌套界面、跨分辨率场景等高难度方向上持续突破。
“别人卷参数,我们卷落地。”实在智能相关负责人说,“我们的目标从来不是榜单排名。而是让每一家企业都能拥有一支“看得准、做得稳、跑得通”的数字员工军团,让AI自动化成为企业基础设施级的能力。”