重新审视Othello世界模型假设
计算与语言
2025-03-07 v1
摘要
Li等人(2023年)将Othello棋盘游戏作为GPT-2诱导世界模型能力的测试用例,随后Nanda等人(2023b)进行了跟进。我们简要讨论原始实验,并将其扩展到包括更多语言模型和更全面的探测。具体而言,我们分析Othello棋盘状态序列,并训练模型基于先前动作预测下一步动作。我们在七种语言模型(GPT-2、T5、Bart、Flan-T5、Mistral、LLaMA-2和Qwen2.5)上评估Othello任务,得出结论:这些模型不仅学会了下Othello,还诱导了Othello棋盘布局。我们发现所有模型在无监督基座对齐方面达到了高达99%的准确率,并且在学到的棋盘特征上表现出高度相似性。这为Othello世界模型假设提供了比先前工作显著更强的证据。
引用
@article{arxiv.2503.04421,
title = {Revisiting the Othello World Model Hypothesis},
author = {Yifei Yuan and Anders Søgaard},
journal= {arXiv preprint arXiv:2503.04421},
year = {2025}
}
备注
ICLR World Models Workshop