压缩以聚焦:多轮 GUI 智能体中策略优化的高效坐标压缩
计算机视觉与模式识别
2026-01-21 v1
摘要
多轮 GUI 智能体通过顺序决策实现复杂任务完成,但随着交互历史的累积,它们受到严重上下文膨胀的困扰。现有策略要么通过截断牺牲长期上下文,要么通过 token 剪枝损害空间结构。在本文中,我们提出了坐标压缩策略优化 (CCPO),这是一个将视觉压缩与策略优化相结合的高效策略优化框架,用于多轮 GUI 智能体。CCPO 引入了坐标感知空间压缩 (CASC),它聚合来自多次 rollout 的坐标以捕获与目标相关的区域,并逐渐将历史注意力集中在关键视觉区域周围。通过跨 rollout 的交互,CASC 自适应地构建注意力边界,将计算集中在场景信息最丰富的区域。我们进一步设计了基于距离的优势,它基于距离而非二元正确性提供细粒度的学习信号,从而提高基础定位精度和压缩质量。大量实验表明,CCPO 在四个基准测试中实现了 SOTA 性能,token 压缩率高达 55%,训练速度提升 3.8 倍。
引用
@article{arxiv.2601.11631,
title = {Compress to Focus: Efficient Coordinate Compression for Policy Optimization in Multi-Turn GUI Agents},
author = {Yurun Song and Jiong Yin and Rongjunchen Zhang and Ian G. Harris},
journal= {arXiv preprint arXiv:2601.11631},
year = {2026}
}