Iris:打破 GUI 复杂性的自适应聚焦与自精炼技术
计算机视觉与模式识别
2025-02-04 v2 人工智能
摘要
数字智能体日益增多地用于自动化处理交互式数字环境中的任务,如网页、软件应用程序和操作系统。虽然基于大语言模型(LLM)的文本型智能体常因平台特定 API 而需要频繁更新,但利用多模态大语言模型(MLLM)的视觉智能体通过直接与图形用户界面(GUI)交互,具备更强的适应性。然而,这些智能体在视觉感知方面面临重大挑战,尤其是处理高分辨率、视觉复杂的数字环境。本文介绍 Iris,一款基础视觉智能体,通过两项关键创新解决这些挑战:信息敏感裁切(ISC)和自精炼双学习(SRDL)。ISC 利用边缘检测算法动态识别并优先处理视觉密集区域,为高信息密度区域分配更多计算资源。SRDL 通过双学习循环增强智能体处理复杂任务的能力:描述 UI 元素(referring)的改进强化定位元素(grounding),反之亦然,无需额外标注数据。实证评估表明,Iris 在多个基准测试上实现了仅用 85 万 GUI 标注即可达到领先水平,显著优于使用 10 倍训练数据的其他方法。这些改进进一步在网页和操作系统智能体下游任务中带来显著提升。
引用
@article{arxiv.2412.10342,
title = {Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining},
author = {Zhiqi Ge and Juncheng Li and Xinglei Pang and Minghe Gao and Kaihang Pan and Wang Lin and Hao Fei and Wenqiao Zhang and Siliang Tang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2412.10342},
year = {2025}
}