9月9日,GUI定位基准ScreenSpot-Pro更新榜单。根据公开榜单,实在智能Indeed-UI-32B以82.7%的任务成功率排名第一,Indeed-UI-8B以81%排名第二,并列同参数量级模型第一。实在智能方面表示,GPT、Claude、Qwen等模型也参与了此次评测。
ScreenSpot-Pro由新加坡国立大学、华东师范大学、香港浸会大学等高校研究团队推出,主要考察模型能否根据自然语言指令,在真实软件界面中准确找到按钮、菜单、输入框等目标位置。
该基准覆盖开发、创意、CAD、科学和办公等专业应用,涉及Windows、macOS、Linux三种操作系统,共设置1581条由专业人员标注的测试指令,相关页面已被Hugging Face收录。
GUI定位通常被视为电脑操作型智能体的基础环节。与普通图像问答不同,模型不仅要理解界面内容,还要输出可执行的点击坐标;一旦关键步骤定位错误,后续操作就可能中断。
此次测试中,两款Indeed-UI模型同时进入前两名,显示出实在智能在界面理解和目标定位方面的阶段性成绩。从模型规模看,Indeed-UI-32B属于较大参数模型,主要体现性能上限;Indeed-UI-8B则强调在较小参数规模下保持较高准确率。
实在智能称,8B模型支持本地化部署,可在企业内网环境运行,部分配置下使用工作站即可完成推理。这类方案主要面向对数据安全、合规和部署成本较为敏感的企业用户,实际效果会受到硬件、量化方式和软件适配等因素影响。
实在智能此前还披露,其智能体在OSWorld评测中取得全球第一,任务执行成功率为90.2%。两项测试关注点有所不同,ScreenSpot-Pro侧重界面元素定位,OSWorld侧重跨软件、多步骤任务完成。前者成绩的提升,有助于电脑操作智能体在办公软件、设计工具及缺乏标准接口的业务系统中执行更精细的操作。
随着企业自动化从API调用扩展到直接操作软件界面,GUI定位精度、小模型效率和本地部署能力正成为行业关注的技术指标。此次榜单结果,也为国产智能体模型在该方向的技术表现提供了一个公开参照。
联系我们
张老师:chenfu3721(微信)
王老师:15222191516(微信)
i黑马,创业黑马旗下媒体,让创业者不再孤独。



