中文

MetaOthello:面向 Transformer 多世界模型的受控研究

机器学习 2026-02-27 v1

摘要

基础模型必须处理多个生成过程,但机制解释主要在孤立能力上进行;仍不清楚单个 Transformer 如何组织多个可能相互冲突的“世界模型”。先前在 Othello -playing 神经网络实验中研究世界模型学习,但聚焦于单一游戏及其单一规则集合。我们引入 MetaOthello,一套受控的 Othello 变体,拥有相同语法但不同规则或分词方式,训练小型 GPT 在混合变体数据上以研究多个世界模型如何在共享表示空间中组织。我们发现,在混合游戏数据上训练的 Transformer 不会将容量分区为孤立的子模型;相反,它们在大多数棋盘状态表示上趋于共享,这些表示可跨变体进行因果迁移。训练在一个变体上的线性探针可有效干预另一个变体的内部状态,干预效果接近匹配探针。对于语法同构且分词remap的游戏,表示在各层上等价,仅相差一个正交旋转。当规则部分重叠时,早期层维持游戏中性表示,中间层识别游戏身份,后期层专化。MetaOthello 为理解不仅 Transformer 是否学习世界模型,以及如何一次组织多个模型提供了路径。

关键词

引用

@article{arxiv.2602.23164,
  title  = {MetaOthello: A Controlled Study of Multiple World Models in Transformers},
  author = {Aviral Chawla and Galen Hall and Juniper Lovato},
  journal= {arXiv preprint arXiv:2602.23164},
  year   = {2026}
}