中文

世界建模提升语言模型智能体性能

人工智能 2025-09-22 v2 机器学习

摘要

在有状态环境中的工具使用对大型语言模型(LLMs)提出了独特的挑战,其中依赖于环境中反复试验的现有测试时计算策略是不切实际的。我们提出了动力学建模,这是一种在后训练期间将状态预测能力与函数调用一起增强 LLMs 的方法。这使得 LLMs 能够通过内部环境模型预测其行为的未来状态。在 Berkeley Function Calling Leaderboard V2 上,DyMo 提高了成功率并显著减少了幻觉。我们进一步将内部环境模型集成到自验证采样(SVS)中,并表明这大幅提高了试验次数 k 上的 pass^k,并允许模型拒绝不可靠的输出。DyMo 和 SVS 共同极大地增强了 LLMs 在工具使用方面的有效性和可靠性。我们相信这项工作为无需重复查询预言机环境的 LLM 推理的可扩展规划 RL 方法开辟了一条道路。

关键词

引用

@article{arxiv.2506.02918,
  title  = {World Modelling Improves Language Model Agents},
  author = {Shangmin Guo and Omar Darwiche Domingues and Raphaël Avalos and Aaron Courville and Florian Strub},
  journal= {arXiv preprint arXiv:2506.02918},
  year   = {2025}
}