Dyna-Think:在 AI 智能体中协同推理、行动与世界模型模拟
人工智能
2025-10-14 v3 计算与语言
机器学习
摘要
大型语言模型 (LLM) 在推理方面的最新进展,如 DeepSeek-R1,在数学和编程等领域展示了令人印象深刻的能力,表现出验证、目标分解和自我反思等复杂认知行为。然而,目前尚不清楚哪些行为对长视野 AI 智能体任务是有效的,以及缺失了哪些行为。在这项工作中,我们提出了 Dyna-Think,一个将内部世界模型的规划与推理和行动相结合的思考框架,以增强 AI 智能体的性能。为了实现 Dyna-Think,我们提出了 Dyna-Think 模仿学习 (DIT) 和 Dyna-Think Dyna 训练 (DDT)。为了初始化具有 Dyna-Think 特性的策略,DIT 重构了 R1 的思考过程,以专注于执行与提议(和计划)的行动相关的世界模型模拟,并使用此重构数据训练策略。为了增强 Dyna-Think,DDT 使用两阶段训练过程,首先通过状态预测或评论生成等目标提高智能体的世界建模能力,然后通过策略训练改进智能体的行动。我们在 OSWorld 和 WindowsAgentArena 上评估了我们的方法,并证明 Dyna-Think 提高了智能体的领域内和领域外性能,与 R1 相比实现了相似的最佳 n 选 1 性能,同时平均生成的 token 数量减少了一半。我们广泛的实证研究表明:1) 使用评论生成进行世界模型训练可有效提高策略性能;2) 性能更好的 AI 智能体与更好的世界建模能力相关。我们相信,我们的结果指出了一个有前景的研究方向,即将世界模型模拟集成到 AI 智能体中以增强其推理、规划和行动能力。
引用
@article{arxiv.2506.00320,
title = {Dyna-Think: Synergizing Reasoning, Acting, and World Model Simulation in AI Agents},
author = {Xiao Yu and Baolin Peng and Ruize Xu and Michel Galley and Hao Cheng and Suman Nath and Jianfeng Gao and Zhou Yu},
journal= {arXiv preprint arXiv:2506.00320},
year = {2025}
}