面向 GUI 智能体的历史上下文感知策略优化——HiconAgent
计算机视觉与模式识别
2026-03-10 v2
摘要
图形用户界面 (GUI) 智能体需要有效利用历史上下文才能完成序列化导航任务。虽然将过去的动作和观察纳入可以提高决策质量,但直接使用完整历史会导致计算开销过大,并且被无关信息干扰。为此,我们提出 HiconAgent,一种基于历史上下文感知策略优化 (HCPO) 训练的 GUI 智能体,以实现历史信息的高效和高效利用。HCPO 通过两个互补组件在抽样和策略更新中优化历史用法:(1) 动态上下文抽样 (DCS) 在抽样期间向智能体呈现可变长度的历史,从而实现对最相关上下文的自适应利用;(2) 锚导式历史压缩 (AHC) 通过双分支策略细化策略更新阶段,其中压缩分支删除历史观察但保留历史动作作为信息流锚点。压缩分支和未压缩分支通过历史增强对齐损失相互耦合,以确保一致的历史用法同时保持效率。实验在主流 GUI 导航基准测试上表现出色。尽管规模更小,HiconAgent-3B 在 GUI-Odyssey 上比 GUI-R1-7B 提升了 8.46 个百分点的 grounding 准确率和 11.32 个百分点的步骤成功率,同时在 AndroidControl 和 AITW 上取得可 comparable 结果,实现了最高 2.47 倍的计算加速和 60% 的 FLOPs 降低。
引用
@article{arxiv.2512.01763,
title = {HiconAgent: History Context-aware Policy Optimization for GUI Agents},
author = {Xurui Zhou and Gongwei Chen and Yuquan Xie and Zaijing Li and Kaiwen Zhou and Shuai Wang and Shuo Yang and Zhuotao Tian and Rui Shao},
journal= {arXiv preprint arXiv:2512.01763},
year = {2026}
}