中文

更好的世界模型可导致更好的后训练性能

机器学习 2025-12-04 v1 人工智能

摘要

在本工作中,我们研究了显式世界模型目标如何影响 Transformer 各训练阶段的内部表征及其下游能力。我们使用受控的 2x2x2 三阶 Rubik's Cube 进行探讨:(1)显式预训练世界模型如何影响模型的潜在表征,以及(2)世界模型质量如何影响模型在强化学习后训练中的性能。我们将标准的下一个标记预测与两种显式世界模型策略进行比较——(i)状态预测预训练和(ii)联合状态预测 + 下一标记目标——并评估在应用组相对政策优化(GRPO)作为后训练后任务性能。我们使用线性探针和因果干预来评估表征质量。我们发现,显式世界建模产生了更具线性可解性和因果可引导的状态表征。更重要的是,我们发现改进的状态表征导致 GRPO 获得更高的提升,尤其是在更难的立方体状态上。我们的结果表明,锐化状态表征可提高序列规划任务后训练的有效性。

关键词

引用

@article{arxiv.2512.03400,
  title  = {Better World Models Can Lead to Better Post-Training Performance},
  author = {Prakhar Gupta and Henry Conklin and Sarah-Jane Leslie and Andrew Lee},
  journal= {arXiv preprint arXiv:2512.03400},
  year   = {2025}
}