屏幕到动作的缺失之处?迈向多模态 GUI 推理的 UI-in-the-Loop 范式
人工智能
2026-04-09 v1
摘要
现有的图形用户界面(GUI)推理任务仍然具有挑战性,尤其是在 UI 理解方面。当前方法通常依赖基于屏幕的直接决策,缺乏可解释性,且忽视了对 UI 元素的全面理解,最终导致任务失败。为增强对 UI 的理解与交互,我们提出了一种名为 UI-in-the-Loop(UILoop)的创新 GUI 推理范式。我们的方法将 GUI 推理任务视为一个循环的"屏幕—UI 元素—动作"过程。通过使多模态大语言模型(MLLM)显式地学习关键 UI 元素的定位、语义功能与实际用法,UILoop 实现了精确的元素发现并执行可解释的推理。此外,我们引入了一个更具挑战性的 UI 理解任务,以 UI 元素为中心,并设有三个评估指标。作为对应,我们贡献了一个包含 26K 个样本的基准数据集(UI Comprehension-Bench),用于全面评估现有方法对 UI 元素的掌握程度。大量实验表明,UILoop 在 UI 理解性能上达到了最先进水平,同时在 GUI 推理任务中也取得了优异结果。
引用
@article{arxiv.2604.06995,
title = {What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning},
author = {Songze Li and Xiaoke Guo and Tianqi Liu and Biao Yi and Zhaoyan Gong and Zhiqiang Liu and Huajun Chen and Wen Zhang},
journal= {arXiv preprint arXiv:2604.06995},
year = {2026}
}
备注
ACL 2026 Findings