中文

利用语言模型先验学习观察到的 POMDP 世界模型

机器学习 2026-05-14 v1

摘要

无论是导航建筑物、操作机器人还是玩游戏,一个有效地在环境中行动的智能体首先都必须学习该环境的内部模型。部分可观测马尔可夫决策过程 (POMDP) 提供了一种灵活的建模类用于此类内部世界模型,但仅凭观察-动作轨迹从观察中学习它们具有挑战性,通常需要大量环境交互。我们询问语言模型先验是否可以通过利用先验知识来减少高昂的交互成本,并引入 \emph{Pinductor} (POMDP-inductor):一种 LLM 从有限的观察-动作轨迹中提出候选 POMDP 模型,并迭代细化以优化基于信念的似然得分。尽管使用信息严格更少,\emph{Pinductor} 仍能匹配 LLM 基于 POMDP 学习方法的性能和样本效率后者假设拥有隐藏状态的特权访问权限,同时显著超越基于表格的 POMDP 基线的样本效率。进一步的结果表明,性能随 LLM 能力而扩展,且在环境语义信息被剥夺时能够优雅地降级。总体而言,这些结果将语言模型先验定位为部分可观测性下样本高效世界模型学习的实用工具,以及通用智能体在真实环境中学习的一步。代码可在 https://github.com/atomresearch/pinductor 获取。

关键词

引用

@article{arxiv.2605.13740,
  title  = {Learning POMDP World Models from Observations with Language-Model Priors},
  author = {Valentin Six and Frederik Panse and Mathis Fajeau and Lancelot Da Costa and Mridul Sharma and Alfonso Amayuelas and Tim Z. Xiao and David Hyland and Philipp Hennig and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2605.13740},
  year   = {2026}
}