棋盘上的大语言模型:关于ChatGPT形式语言理解与复杂推理能力的研究
计算与语言
2023-08-30 v1
摘要
尽管大语言模型在自然语言处理方面取得了进展,但其在需要形式语言理解(如国际象棋)的复杂推理任务中的能力仍较少被研究。本文以国际象棋为案例,探究OpenAI的复杂语言模型ChatGPT在此类复杂推理任务上的表现。通过考察走子合法性与质量的稳健指标,我们评估了ChatGPT对棋盘的理解、对国际象棋规则的遵守以及战略决策能力。我们的评估识别出ChatGPT注意力机制中影响其形式语言理解的局限,并揭示了该模型尚未充分发展的自我调节能力。我们的研究还揭示了ChatGPT在对弈中倾向于连贯策略,并且当模型接收到更大量的自然语言或对所处棋盘状态有更清晰理解时,其决策自信明显增强。这些发现有助于拓展对语言模型超越自然语言处理能力的探索,为未来朝向展现类人认知能力的模型研究提供有价值的信息。
引用
@article{arxiv.2308.15118,
title = {Large Language Models on the Chessboard: A Study on ChatGPT's Formal Language Comprehension and Complex Reasoning Skills},
author = {Mu-Tien Kuo and Chih-Chung Hsueh and Richard Tzong-Han Tsai},
journal= {arXiv preprint arXiv:2308.15118},
year = {2023}
}