中文

PRO-CUA:面向计算机使用智能体的过程-奖励优化

人工智能 2026-05-29 v1

摘要

计算机使用智能体(CUA)已显示出强大的潜力用于自动化复杂的数字工作流程,但其训练受限于高成本的现场环境交互和有限的高质量监督。现有的过滤行为克隆管道受限于模仿瓶颈,包括专家演示的分布迁移和缺乏负面学习信号。同时,标准的轨迹级强化学习在奖励稀疏、信用分配模糊以及长期GUI交互的高基础设施成本方面受限。本文提出PRO-CUA,一种用于训练CUA的过程-奖励优化框架。PRO-CUA将on-policy环境交互与策略优化解耦:当前策略通过在线 rollout 收集状态,为每个状态生成多样化的候选动作,接收来自过程奖励模型(PRM)的step级反馈,并使用组相对优势进行优化。该设计在不依赖黄金答案或离线专家轨迹的情况下,实现稠密且灵活的信用分配,同时通过在智能体自身执行状态上训练来减少分布迁移。基于live web基准的实验表明PRO-CUA的有效性以及PRM引导的step级训练的可靠性。

关键词

引用

@article{arxiv.2605.29119,
  title  = {PRO-CUA: Process-Reward Optimization for Computer Use Agents},
  author = {Yifei He and Rui Yang and Hao Bai and Tong Zhang and Han Zhao},
  journal= {arXiv preprint arXiv:2605.29119},
  year   = {2026}
}