中文

基于视频的奖励建模用于计算机操作智能体

计算机视觉与模式识别 2026-03-12 v1 计算与语言

摘要

计算机操作智能体 (CUA) 正变得越来越有能力;然而,扩大是否真正满足用户指令的轨迹评估仍然困难。本文我们研究来自执行视频的奖励建模:来自智能体轨迹的时间轴关键帧序列,这些关键帧独立于智能体的内部推理或操作。虽然视频执行建模是方法中立的,但它呈现出关键挑战,包括高度冗余的布局和决定成功性的细微局部线索。我们引入 Execution Video Reward 53k (ExeVR-53k),包含 53k 个高质量视频-任务-奖励三元组的数据集。我们进一步提出对抗性指令翻译,以获得带有步骤级注释的负面样本。为实现对长时间、高分辨率执行视频的学习,我们设计了时空 token 剪枝,该技术在保留决定性 UI 更改的同时删除同质区域和持久 token。基于这些组件,我们微调了一个执行视频奖励模型 (ExeVRM),该模型仅接受用户指令和视频执行序列即可预测任务成功。我们的 ExeVRM 8B 在视频执行评估方面达到 84.7% 的准确率和 87.7% 的召回率,超过了 GPT-5.2 和 Gemini-3 Pro 等强大的专有模型,在 Ubuntu、macOS、Windows 和 Android 平台上表现更好,同时提供更精确的时序归因。这些结果表明,视频执行奖励建模可作为 CUAs 的可扩展、模型中立评估器。

关键词

引用

@article{arxiv.2603.10178,
  title  = {Video-Based Reward Modeling for Computer-Use Agents},
  author = {Linxin Song and Jieyu Zhang and Huanxin Sheng and Taiwei Shi and Gupta Rahul and Yang Liu and Ranjay Krishna and Jian Kang and Jieyu Zhao},
  journal= {arXiv preprint arXiv:2603.10178},
  year   = {2026}
}