人类-智能体异步 rollout:长期任务训练中的交互
人工智能
2025-11-04 v2
摘要
大型语言模型(LLM)代理人最近在自动编码、深度研究和图形用户界面操作等领域显示出强大的潜力。然而,在针对长期、领域专业任务的训练方面仍存在挑战。当前方法主要分为两类。第一类依赖通过行为克隆进行密集的人类标注,对那些需要数天或数月才能完成的长期任务来说代价高昂。第二类依赖以结果为导向的抽样,在领域专业任务上,由于有效正轨迹的稀缺性,常常会崩溃。我们引入 Apollo,一种将异步人类指导与动作级数据过滤集成的抽样框架。不要求注释员在每一步都跟随代理,Apollo 允许他们仅在代理偏离有前景轨迹时进行干预,通过提供先验知识、战略建议等。这种轻量级设计使得与人类的交互可持续超过 30 小时,并且以更低的成本产生有价值的轨迹。Apollo 然后应用监督控制来过滤次优动作并防止错误传播。结合这些组件,Apollo 能够在长期环境中可靠且有效地收集数据。为演示 Apollo 的有效性,我们使用 InnovatorBench 进行评估。我们的实验表明,针对在 InnovatorBench 上训练 GLM-4.5 模型的 Apollo,相较于未训练的基线实现了超过 50% 的改进,相较于不使用人类交互训练的变体实现了 28% 的改进。这些结果突显了人类在环抽样的关键作用以及 Apollo 设计在处理长期、领域专业任务方面的鲁健性。
引用
@article{arxiv.2510.27630,
title = {Interaction as Intelligence Part II: Asynchronous Human-Agent Rollout for Long-Horizon Task Training},
author = {Dayuan Fu and Yunze Wu and Xiaojie Cai and Lyumanshan Ye and Shijie Xia and Zhen Huang and Weiye Si and Tianze Xu and Jie Sun and Keyu Li and Mohan Jiang and Junfei Wang and Qishuo Hua and Pengrui Lu and Yang Xiao and Pengfei Liu},
journal= {arXiv preprint arXiv:2510.27630},
year = {2025}
}