中文

GUI-AIMA:面向 GUI 定位的内在多模态注意力与上下文锚点对齐

计算机视觉与模式识别 2026-03-30 v3 人工智能 计算与语言 人机交互 机器学习

摘要

图形用户界面(GUI)定位是计算机使用智能体将自然语言指令映射到屏幕可操作区域的关键能力。现有的多模态大语言模型(MLLM)方法通常将 GUI 定位表述为文本基坐标生成任务。然而,直接从视觉输入生成精确坐标具有挑战性且数据需求大。更直观的策略是首先识别与指令相关的视觉块,然后在其中确定确切的点击位置。受最近观察到通用 MLLM 在注意力图中内置定位能力的启发,我们提出GUI-AIMA,这是一种基于注意力的、无坐标监督微调框架,用于高效 GUI 定位。GUI-AIMA 将 MLLM 的内在多模态注意力与块级定位信号对齐。这些信号通过对简化查询-视觉注意力矩阵的多头聚合以适应不同用户指令而计算。此外,其无坐标方式可以轻松集成可插拔的放大阶段。仅用50.9万样本(约10.1万张屏幕截图)训练的GUI-AIMA-3B模型,展示了卓越的数据效率,验证了轻量训练即可激发 MLLM 的内置定位能力。它在ScreenSpot-Pro上实现了61.5%的平均准确率,在ScreenSpot-v2上达到92.1%,在OSWorld-G上达到68.1%,在MMBench-GUI-L2上达到79.1%,在UI-Vision上达到60.0%。项目页面: https://github.com/sjz5202/GUI-AIMA

关键词

引用

@article{arxiv.2511.00810,
  title  = {GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding},
  author = {Shijie Zhou and Viet Dac Lai and Hao Tan and Jihyung Kil and Wanrong Zhu and Changyou Chen and Ruiyi Zhang},
  journal= {arXiv preprint arXiv:2511.00810},
  year   = {2026}
}