中文

重新审视Othello世界模型假设

计算与语言 2025-03-07 v1

摘要

Li等人(2023年)将Othello棋盘游戏作为GPT-2诱导世界模型能力的测试用例,随后Nanda等人(2023b)进行了跟进。我们简要讨论原始实验,并将其扩展到包括更多语言模型和更全面的探测。具体而言,我们分析Othello棋盘状态序列,并训练模型基于先前动作预测下一步动作。我们在七种语言模型(GPT-2、T5、Bart、Flan-T5、Mistral、LLaMA-2和Qwen2.5)上评估Othello任务,得出结论:这些模型不仅学会了下Othello,还诱导了Othello棋盘布局。我们发现所有模型在无监督基座对齐方面达到了高达99%的准确率,并且在学到的棋盘特征上表现出高度相似性。这为Othello世界模型假设提供了比先前工作显著更强的证据。

关键词

引用

@article{arxiv.2503.04421,
  title  = {Revisiting the Othello World Model Hypothesis},
  author = {Yifei Yuan and Anders Søgaard},
  journal= {arXiv preprint arXiv:2503.04421},
  year   = {2025}
}

备注

ICLR World Models Workshop