中文

思考与行动:通过规模化测试时交互进行推理的智能体

机器学习 2025-06-11 v2 人工智能

摘要

当前测试时规模化范式依赖于在生成响应之前生成长推理痕迹(“思考更多”)。在需要与环境交互的智能体问题中,这可以通过在与世界交互前生成思考痕迹来实现。然而,这一过程不允许智能体从环境中获取新信息或随时间调整其行为。在本文中,我们提出规模化测试时交互(tti),这是一种未被充分利用的测试时规模化维度,通过增加智能体的交互时域 horizon,使其能够在单个 rollout内运行丰富的行为,如探索、回溯和动态重新规划。为展示该规模化维度的潜力,我们研究 web agent 领域。首先,我们表明,即使没有任何训练,基于提示的交互规模化仍可在 web基准测试中实现非平凡的任务成功率提升。基于此,我们引入tti(test-time interaction),一种基于课程的在线强化学习(rl)方法,通过自适应调整 rollout 长度来训练智能体。使用Gemma 3 12B模型,tti在WebVoyager和WebArena基准测试中实现了最先进的开源、开放数据 web agent。我们进一步表明,tti使智能体能够自适应地平衡探索与开发。我们的结果确立了交互规模化作为一种强大且互补于每步计算规模化的重要维度,为训练自适应智能体提供了新途径。

关键词

引用

@article{arxiv.2506.07976,
  title  = {Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction},
  author = {Junhong Shen and Hao Bai and Lunjun Zhang and Yifei Zhou and Amrith Setlur and Shengbang Tong and Diego Caples and Nan Jiang and Tong Zhang and Ameet Talwalkar and Aviral Kumar},
  journal= {arXiv preprint arXiv:2506.07976},
  year   = {2025}
}

备注

Fixed typo in Figure 6 and Conclusion