中文

国际象棋语言模型中的涌现世界模型与潜变量估计

机器学习 2024-07-16 v2 计算与语言

摘要

语言模型展现出前所未有的能力,引发了关于其性能来源的争论:它仅仅是学习句法模式和表层统计的结果,还是从文本中提取了语义和世界模型?Li 等人先前的工作通过在一个合成的、随机生成的奥赛罗棋局上训练 GPT 模型对此进行了研究,发现模型学习了棋盘状态的内部表征。我们将这项工作扩展到更复杂的国际象棋领域,在真实棋局上进行训练,并使用线性探针和对比激活来研究模型的内部表征。模型没有获得任何关于游戏的先验知识,仅通过预测下一个字符进行训练,但我们发现了其内部表征棋盘状态的证据。我们通过利用这些内部表征对模型的激活进行干预并编辑其内部棋盘状态来验证它们。与 Li 等人先前的合成数据集方法不同,我们的分析发现,模型还学会了估计诸如棋手技能等潜变量,以更好地预测下一个字符。我们推导出一个棋手技能向量并将其添加到模型中,将模型的胜率提高了最多 2.6 倍。

关键词

引用

@article{arxiv.2403.15498,
  title  = {Emergent World Models and Latent Variable Estimation in Chess-Playing Language Models},
  author = {Adam Karvonen},
  journal= {arXiv preprint arXiv:2403.15498},
  year   = {2024}
}

备注

Accepted to the 2024 Conference on Language Modeling