中文

通过探索扩展面向智能体的合成任务生成

人工智能 2025-09-30 v1

摘要

对多模态大语言模型(MLLMs)进行后训练以构建交互式智能体,在计算机使用、网页导航和机器人等领域具有广阔前景。扩展此类后训练的一个关键挑战是缺乏高质量的下游智能体任务数据集,这些任务需要具备多样性、可行性和可验证性。现有的任务生成方法严重依赖人工标注或使用有限的下游环境信息提示MLLM,前者成本高昂,后者由于生成的任务覆盖范围有限而难以扩展。为了解决这一问题,我们提出了AutoPlay,一个可扩展的任务生成流水线,它显式地探索交互式环境以发现可能的交互和当前状态信息,从而合成基于环境的任务。AutoPlay分两个阶段运行: 探索阶段,MLLM探索智能体系统地发现新的环境状态和功能; 任务生成阶段,任务生成器利用探索轨迹和一组任务指南提示作为上下文,合成多样、可执行且可验证的任务。我们展示了AutoPlay在20个Android应用上生成了2万个任务,在13个Ubuntu应用上生成了1万个任务,用于训练移动端使用和计算机使用智能体。AutoPlay生成的任务通过采用MLLM任务执行器和验证器,实现了无需人工标注的大规模任务示范合成。这些数据使得能够训练基于MLLM的UI智能体,在移动端使用和计算机使用场景中成功率分别提升高达20.0%20.0\%10.9%10.9\%。此外,AutoPlay生成的任务结合基于MLLM验证器的奖励,使得能够扩展UI智能体的强化学习训练,带来了额外的5.7%5.7\%提升。这些结果确立了AutoPlay作为一种可扩展的方法,用于后训练具备能力的MLLM智能体,减少了对人工标注的依赖。

关键词

引用

@article{arxiv.2509.25047,
  title  = {Scaling Synthetic Task Generation for Agents via Exploration},
  author = {Ram Ramrakhya and Andrew Szot and Omar Attia and Yuhao Yang and Anh Nguyen and Bogdan Mazoure and Zhe Gan and Harsh Agrawal and Alexander Toshev},
  journal= {arXiv preprint arXiv:2509.25047},
  year   = {2025}
}