首页 > 爱酱资讯 >微软OmniParser V2.0:让AI模型秒变电脑操控高手,已开源

微软OmniParser V2.0:让AI模型秒变电脑操控高手,已开源

2025-02-18爱酱手游网

微软近期在人工智能领域再次迈出重要一步,推出了OmniParser V2.0,这是一款基于纯视觉技术的GUI智能体解析工具,能够精准识别并解析屏幕上的可交互图标。此前,该工具与GPT-4V的结合已显著提升了其识别能力。

在2月12日,微软官方网站上正式发布了OmniParser的最新版本。这一版本不仅延续了前代产品的优势,还实现了与多个先进AI模型的兼容,包括OpenAI的多个版本(4o、o1、o3-mini)、DeepSeek R1、Qwen 2.5VL以及Anthropic的Sonnet等。这意味着这些模型在OmniParser的助力下,能够转变为操控计算机的AI智能体。

相较于V1版本,OmniParser V2.0在训练数据上进行了大幅升级,采用了更大规模的交互元素检测数据和图标功能标题数据。这一改进使得V2.0在检测较小的可交互UI元素时,准确率有了显著提升,同时推理速度也更快,延迟降低了60%。

在高分辨率Agent基准测试ScreenSpot Pro中,OmniParser V2.0与GPT-4o的结合展现出了惊人的效果。测试结果显示,V2.0+GPT-4o的准确率高达39.6%,而GPT-4o单独使用时,准确率仅为0.8%。这一对比充分展示了OmniParser V2.0在提升AI模型性能方面的巨大潜力。

为了加速不同智能体设置的实验进程,微软还推出了OmniTool这一开源工具。OmniTool是一个集成了屏幕理解、定位、动作规划和执行等基本功能的Docker化Windows系统。这一工具为将大模型转变为智能体提供了关键支持,极大地简化了实验过程。

对于对OmniParser和OmniTool感兴趣的开发者而言,微软已经提供了开源地址,方便他们获取并使用这些工具,以进一步推动人工智能技术的发展。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表本站立场。文章及其配图仅供学习分享之

2932
271

同类推荐更多

欧美尺码日本尺码如何专线转换?美国尺码的秘密在哪里?

欧美尺码日本尺码如何专线转换?美国尺码的秘密在哪里?

最火的爱酱资讯

2025-01-07

欧美尺码与日本尺码的专线转换 在进行欧美尺码与日本尺码的转换时,我们需要明确各自的尺码体系及其特点。欧美尺码通常以英寸为单位,而日本尺码则常常以厘米或公分为基准。以下是二者的专线转换方法。 一、了解尺码体系 在开始转换之前,我们需要对欧美尺码和日本尺码的体系有基本的了解。欧美尺码通常以S、M、L等字母表示,而日本尺码则是以数字和尺寸(如厘米或公分)来标示。此外,还需注意不同的衣物类别(如裤子、上