中文

将国际象棋作为语言模型状态追踪的测试平台

计算与语言 2022-05-17 v2 人工智能

摘要

Transformer语言模型在自然语言理解任务中取得了巨大进展。然而,自然语言的复杂性使得我们难以确定这些模型在多大程度上准确追踪了文本背后的世界状态。受此问题驱动,我们考虑国际象棋游戏的语言建模任务。与自然语言不同,象棋记谱法描述了一个简单、受限且确定性的领域。此外,我们观察到,恰当选择象棋记谱法可以直接探查世界状态,而无需任何额外的探查相关机制。我们发现:(a) 在拥有足够训练数据的情况下,Transformer语言模型仅基于走子序列训练时,就能以高准确率学习追踪棋子并预测合法走法。(b) 对于提供棋盘状态信息的小规模训练集,在训练期间可带来显著提升。(c) Transformer语言模型的成功依赖于对整局游戏历史的访问,即“全注意力”。近似该全注意力会导致性能显著下降。我们提出将此测试平台作为未来开发和解析Transformer语言模型工作的基准。

关键词

引用

@article{arxiv.2102.13249,
  title  = {Chess as a Testbed for Language Model State Tracking},
  author = {Shubham Toshniwal and Sam Wiseman and Karen Livescu and Kevin Gimpel},
  journal= {arXiv preprint arXiv:2102.13249},
  year   = {2022}
}

备注

AAAI 2022 extended version with supplementary material