中文

混合专家知识:将人类思维带回围棋游戏

计算与语言 2026-01-26 v1

摘要

大型语言模型(LLM)在数学和编码等推理任务中展现出卓越的表现,甚至媲美甚至超越人类能力。然而,这些令人印象深刻的推理能力在专业领域面临显著挑战。以围棋为例,尽管AlphaGo已确立了AI系统在围棋中达到的高性能天花板,但主流LLM仍难以达到甚至初学者水平,更别说进行自然语言推理了。这一通用LLM与领域专家之间的性能差距显著限制了LLM在更广泛的特定任务中的应用。本文旨在弥合LLM通用推理能力与特定领域专家知识之间的鸿沟。我们采用结构化的围棋专家知识与通用长链思维(Chain-of-Thought, CoT)推理数据进行混合微调,作为冷启动;随后通过强化学习将围棋专家知识与通用推理能力相结合。通过该方法,我们提出了LoGos——一种强大的LLM,既保持出色的通用推理能力,又能以自然语言进行围棋游戏,展现有效的战略推理和准确的下一步着法预测。LoGos的性能与人类职业水平相当,显著超越了现有的全部LLM。通过本工作,我们旨在为将通用LLM推理能力应用于特定领域提供思路。我们将发布首个大规模围棋数据集用于LLM训练、首个围棋评估基准以及首个达到人类职业水平的通用LLM,地址为:https://github.com/Entarochuan/LoGos。

关键词

引用

@article{arxiv.2601.16447,
  title  = {Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go},
  author = {Yichuan Ma and Linyang Li and Yongkang Chen and Peiji Li and Jiasheng Ye and Qipeng Guo and Dahua Lin and Kai Chen},
  journal= {arXiv preprint arXiv:2601.16447},
  year   = {2026}
}

备注

Accepted to NeurIPS 2025