中文

基于大语言模型的世界模型可独立决策,但需要严格评估

人工智能 2026-03-20 v2

摘要

世界模型作为决策制定中的关键模块崭露头角,MuZero 和 Dreamer 在复杂任务中取得了显著成功。近期工作利用大语言模型(LLMs)作为通用世界模拟器来模拟世界动态,得益于其泛化能力。LLMs 还在基于规划的推理(RAP)和思维树(ToT)中作为世界模型用于深思熟虑的推理。然而,世界模型要么被评估为通用世界模拟器,要么被评估为智能体的功能模块,即预测转移以辅助规划。在本工作中,我们从决策制定的角度提出了对基于 LLMs 的世界模型的全面评估。具体而言,我们利用(Wang et al., 2023;2024)中的 31 个多样化环境,并整理每个环境的基于规则的策略以进行多样化评估。然后,我们设计了三个主要任务,即策略验证、动作提议和策略规划,在这些任务中世界模型可单独用于决策制定。最后,我们在各种设置下对先进的 LLMs(即 GPT-4o 和 GPT-4o-mini)在三个主要任务上的环境进行全面评估。关键观察包括:i) GPT-4o 在三个主要任务上显著优于 GPT-4o-mini,尤其是在需要领域知识的任务上;ii) 基于 LLM 的世界模型在长期决策任务上的性能会下降;iii) 世界模型不同功能的组合会带来额外的性能不稳定性。

关键词

引用

@article{arxiv.2411.08794,
  title  = {LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed},
  author = {Chang Yang and Xinrun Wang and Junzhe Jiang and Qinggang Zhang and Xiao Huang},
  journal= {arXiv preprint arXiv:2411.08794},
  year   = {2026}
}

备注

Accepted to TMLR