探索 LLM 在国际象棋测试平台中的推理能力
计算与语言
2025-03-03 v2 人工智能
摘要
推理是人类智能的核心能力。近年来,随着大规模数据集的出现,预训练大语言模型已经展现出新的能力,包括推理。然而,这些模型在长期、复杂的推理任务(如国际象棋)上仍然存在困难。基于专家棋手采用结合长期战略博弈与短期战术博弈以及语言解释的 dual approach 的观察,我们提出通过整合标注的策略和战术来提升大语言模型在国际象棋中的推理能力。具体而言,我们收集了一个名为 MATE 的数据集,包含 100 万个国际象棋棋局位置,并由国际象棋专家对候选着法进行策略和战术标注。我们对 LLaMA-3-8B 模型进行了微调,并在选择更优国际象棋着法的任务中将其与最先进的商业语言模型进行了对比。我们的实验表明,我们的模型在性能上优于 GPT、Claude 和 Gemini 模型。我们发现语言解释可以增强大语言模型的推理能力。
引用
@article{arxiv.2411.06655,
title = {Explore the Reasoning Capability of LLMs in the Chess Testbed},
author = {Shu Wang and Lei Ji and Renxi Wang and Wenxiao Zhao and Haokun Liu and Yifan Hou and Ying Nian Wu},
journal= {arXiv preprint arXiv:2411.06655},
year = {2025}
}
备注
NAACL2025 Main Conference. Data and models are available: https://mate-chess.github.io/