通过 Logit 锐利度理解 GUI Agent 本地化偏置
计算与语言
2025-06-19 v1
摘要
多模态大语言模型 (MLLM) 已使 GUI agent 能够通过将语言 grounding 到空间动作来与操作系统交互。尽管其前景光明,但这些模型经常出现幻觉——系统性的本地化错误,损害可靠性。我们提出了一个细粒度评估框架,将模型预测分为四种不同类型,揭示了传统准确率指标之外的细微失效模式。为更好地量化模型不确定性,我们引入了峰值锐利度分数 (PSS),该指标评估语义连续性与坐标预测 logits 分布之间的对齐程度。基于此洞见,我们进一步提出了上下文感知裁切 (Context-Aware Cropping),这是一种无需训练的训练技术,通过自适应细化输入上下文来提高模型性能。大量实验表明,我们的框架和方法提供了可操作的见解,并增强了 GUI agent 行为的可解释性和鲁棒性。
引用
@article{arxiv.2506.15425,
title = {Understanding GUI Agent Localization Biases through Logit Sharpness},
author = {Xingjian Tao and Yiwei Wang and Yujun Cai and Zhicheng Yang and Jing Tang},
journal= {arXiv preprint arXiv:2506.15425},
year = {2025}
}