世界建模提升语言模型智能体性能
人工智能
2025-09-22 v2 机器学习
摘要
在有状态环境中的工具使用对大型语言模型(LLMs)提出了独特的挑战,其中依赖于环境中反复试验的现有测试时计算策略是不切实际的。我们提出了动力学建模,这是一种在后训练期间将状态预测能力与函数调用一起增强 LLMs 的方法。这使得 LLMs 能够通过内部环境模型预测其行为的未来状态。在 Berkeley Function Calling Leaderboard V2 上,DyMo 提高了成功率并显著减少了幻觉。我们进一步将内部环境模型集成到自验证采样(SVS)中,并表明这大幅提高了试验次数 k 上的 pass^k,并允许模型拒绝不可靠的输出。DyMo 和 SVS 共同极大地增强了 LLMs 在工具使用方面的有效性和可靠性。我们相信这项工作为无需重复查询预言机环境的 LLM 推理的可扩展规划 RL 方法开辟了一条道路。
引用
@article{arxiv.2506.02918,
title = {World Modelling Improves Language Model Agents},
author = {Shangmin Guo and Omar Darwiche Domingues and Raphaël Avalos and Aaron Courville and Florian Strub},
journal= {arXiv preprint arXiv:2506.02918},
year = {2025}
}