中文

探秘token偏差:大语言模型尚未是真正的推理者

计算与语言 2024-10-07 v2 人工智能

摘要

本研究提出一种假设检验框架,以评估大语言模型(LLM)是否具备真正的推理能力,或主要依赖token偏差。我们不仅评估LLM的准确率,更旨在探究其解决逻辑推理任务时的token偏差。具体而言,我们构建严格控制的合成数据集,包含连词谬误和三段论问题。该框架列出一系列可被明确识别的假设,其中所有零假设均假设LLM具备真正的推理能力。研究结果表明,基于统计学保证,大多数LLM在逻辑推理方面仍存在挑战。尽管它们在经典问题上表现良好,但其成功主要依赖于识别具有强token偏差的表面模式,从而引发对其实际推理与泛化能力的广泛质疑。该研究的代码与数据已开源于https://github.com/bowen-upenn/llm_token_bias。

关键词

引用

@article{arxiv.2406.11050,
  title  = {A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners},
  author = {Bowen Jiang and Yangxinyu Xie and Zhuoqun Hao and Xiaomeng Wang and Tanwi Mallick and Weijie J. Su and Camillo J. Taylor and Dan Roth},
  journal= {arXiv preprint arXiv:2406.11050},
  year   = {2024}
}

备注

This paper has been accepted at EMNLP 2024