中文

AQuaUI:基于自适应四分树的GUI代理可视化标记减少

人工智能 2026-05-20 v1 计算机视觉与模式识别 多智能体系统

摘要

大型多模态模型(LMM)最近涌现出作为GUI代理模型的有前景的 backbone,其中高分辨率GUI屏幕截图被引入提示词的每个迭代步骤中。然而,这些屏幕截图显示出高度非均匀的空间信息密度:大区域可能携带很少信息且在视觉上是同质的,而关键文本和图标可能需要高视觉保真度。现有方法要么需要额外训练,要么依赖基于注意力的标记压缩,忽略了GUI屏幕截图的结构化布局和空间冗余。为填补这一差距,本文提出AQuaUI,这是一个针对GUI代理模型的训练-free推理时标记减少方法,利用屏幕截图中非均匀的信息密度。AQuaUI在每个屏幕截图输入上构建自适应四分树,并保留每个叶节点的一个代表性合并标记。AQuaUI在管道中保留保留标记的空间位置,以确保所有位置编码阶段保持一致。为了进一步提高跨多步GUI交互的时序一致性,我们提出了一种条件四分树算法,利用连续屏幕截图之间的连续性。具体而言,它使用前一个四分树作为参考来细化当前四分树,有助于在静态或轻微偏移的GUI状态下保留细粒度区域。我们在最先进的GUI代理模型上实现AQuaUI,并在标准 grounding 和 navigational 基准测试上进行实验。AQuaUI在所有先前基准方法中持续实现准确性-效率权衡的改进。值得注意的是,在GUI-Owl-1.5-32B-Instruct上,AQuaUI实现了最高达13.22%的加速和29.52%的视觉标记减少,同时保留了99.06%的全标记性能,表明GUI屏幕截图的空间冗余可以在推理时而无需重新训练地被利用。

关键词

引用

@article{arxiv.2605.19260,
  title  = {AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees},
  author = {Yuankai Li and Tinghui Zhu and Ha Min Son and Zhe Zhao and Xin Liu and Muhao Chen},
  journal= {arXiv preprint arXiv:2605.19260},
  year   = {2026}
}