中文

ChessGPT:桥接策略学习与语言建模

机器学习 2023-12-22 v2 人工智能

摘要

在解决决策任务时,人类通常依赖两个关键来源的信息:(1)历史策略数据,提供来自环境的交互回放;(2)自然语言形式的分析性见解,揭示宝贵的思维过程或战略考量。尽管如此,以往多数研究仅关注其中一个来源:它们要么仅利用历史回放直接学习策略或价值函数,要么仅使用纯语言语料进行语言模型训练。本文认为,一个强大的自主智能体应涵盖这两个来源。因此,我们提出 ChessGPT,一种通过整合象棋游戏中这两类数据来桥接策略学习与语言建模的 GPT 模型。具体而言,我们构建了与象棋相关的大规模对局与语言数据集。借助该数据集,我们展示了 ChessCLIP 与 ChessGPT 两个模型示例,实现了策略学习与语言建模的融合。最后,我们提出一个用于评估语言模型象棋能力的完整评测框架。实验结果验证了我们模型与数据集的有效性。我们在 https://github.com/waterhorse1/ChessGPT 开源了代码、模型与数据集。

关键词

引用

@article{arxiv.2306.09200,
  title  = {ChessGPT: Bridging Policy Learning and Language Modeling},
  author = {Xidong Feng and Yicheng Luo and Ziyan Wang and Hongrui Tang and Mengyue Yang and Kun Shao and David Mguni and Yali Du and Jun Wang},
  journal= {arXiv preprint arXiv:2306.09200},
  year   = {2023}
}

备注

Published as a conference article in NeurIPS 2023