中文

TextGames: 通过语言模型推理学习自我对弈文本基义游戏

计算与语言 2025-02-26 v1 人工智能

摘要

推理是大型语言模型 (LLM) 的基本能力,使其能够理解、分析和解决复杂问题。本文引入 TextGames,一个专为评估 LLM 而设计的创新基准,通过需要高级模式识别、空间意识、算术和逻辑推理技能的文本基义游戏来考验。我们的分析探讨了 LLM 在单轮和多轮推理中的表现,以及其在利用反馈纠正后续答案通过自我反思方面的能力。我们的发现表明,尽管 LLM 在解决大多数容易和中等难度问题方面表现出色,但在更具挑战性的任务方面面临重大挑战。相比之下,人类在给定充足时间时能够解决所有任务。此外,我们观察到 LLM 在通过自我反思进行多轮预测时表现有所提升,但仍在排序、计数和持续遵循复杂规则方面困难重重。此外,针对推理优化的模型表现优于以指令遵循为优先级的预训练 LLM,这突显了推理技能在解决高度复杂问题方面的关键作用。

关键词

引用

@article{arxiv.2502.18431,
  title  = {TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning},
  author = {Frederikus Hudi and Genta Indra Winata and Ruochen Zhang and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2502.18431},
  year   = {2025}
}