中文

VideoAgentTrek:从无标签视频中进行计算机使用预训练

计算与语言 2025-10-23 v1 人工智能 机器学习

摘要

训练计算机使用智能体需要大量GUI交互数据,但在大规模上手动标注动作轨迹代价高昂。我们提出VideoAgentTrek,一个可扩展的管道,从公开的屏幕录制视频中自动挖掘训练数据,实现规模化,无需手动标注。我们的解决方法针对关键挑战:原始视频包含隐式演示但缺乏明确的动作标签。为此,我们开发了Video2Action,一个逆向动力学模块(IDM),包含两个组件:(1)视频 grounding模型检测并定位具有精确时间边界和上下文的GUI动作;(2)动作-内容识别器以高保真度提取结构化参数,如点击坐标和输入文本。应用于39,000个YouTube教程视频,我们的管道自动生成152万个交互步骤。通过持续预训练后进行监督微调,我们在OSWorld-Verified上将任务成功率从9.3%(仅SFT基线)提升至15.8%,实现70%的相对提升。在AgentNetBench上,步骤准确率从64.1%提升至69.3%。我们的结果表明,被动互联网视频可转化为为计算机使用智能体提供高质量监督,为昂贵的手动标注提供了可扩展的替代方案。

关键词

引用

@article{arxiv.2510.19488,
  title  = {VideoAgentTrek: Computer Use Pretraining from Unlabeled Videos},
  author = {Dunjie Lu and Yiheng Xu and Junli Wang and Haoyuan Wu and Xinyuan Wang and Zekun Wang and Junlin Yang and Hongjin Su and Jixuan Chen and Junda Chen and Yuchen Mao and Jingren Zhou and Junyang Lin and Binyuan Hui and Tao Yu},
  journal= {arXiv preprint arXiv:2510.19488},
  year   = {2025}
}

备注

8 pages, 6 figures