LPO:通过位置偏好优化实现精准 GUI 智能体交互
机器学习
2026-04-22 v3 人工智能
计算机视觉与模式识别
摘要
自主智能体的出现正在通过自然语言这一强大中介改变与图形用户界面(GUI)的交互方式。尽管当前 GUI 智能体主要依赖监督微调(SFT)方法来实现空间定位,但这些方法因准确感知位置数据的能力有限而面临重大挑战。强化学习等现有策略往往无法有效评估位置准确性,从而限制了其用途。为此,我们提出位置偏好优化(LPO),一种利用位置数据优化交互偏好的新方法。LPO 利用信息熵,通过聚焦信息丰富的区域来预测交互位置。此外,它进一步引入基于物理距离的动态位置奖励函数,反映不同交互位置的重要性。在组相对偏好优化(GRPO)的支持下,LPO 促进了对 GUI 环境的广泛探索,并显著提升了交互精度。全面实验表明 LPO 取得了优异性能,在离线基准和真实在线评估中均达到 SOTA 水平。我们的代码将很快公开发布,地址为 https://github.com/jqtangust/LPO。
引用
@article{arxiv.2506.09373,
title = {LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization},
author = {Jiaqi Tang and Yu Xia and Yi-Feng Wu and Yuwei Hu and Yuhui Chen and Qing-Guo Chen and Xiaogang Xu and Xiangyu Wu and Hao Lu and Yanqing Ma and Shiyin Lu and Qifeng Chen},
journal= {arXiv preprint arXiv:2506.09373},
year = {2026}
}
备注
Accepted by ACL 2026 Findings