中文

关键token matters:基于对比估计的token级方法提升LLM推理能力

计算与语言 2025-01-14 v3 人工智能 机器学习

摘要

数学推理任务对大语言模型(LLM)构成重大挑战,因为它们需要精确的逻辑推演和序列分析。本文引入关键token的概念——推理轨迹中显著影响错误结果的要素。我们提出了通过 rollout 采样识别这些token的新方法,证明这些token与传统错误token存在显著差异。通过在GSM8K和MATH500等数据集上进行大量实验,我们表明识别并替换关键token可显著提升模型准确率。我们提出了一种高效方法,用于在大规模数据集中定位这些token,采用对比估计并将该框架扩展到增强模型训练过程的直接偏好优化(DPO)。在广泛使用的Llama-3(8B和70B)和Deepseek-math(7B)模型上进行GSM8K和MATH500基准测试的实验结果表明,所提出的方法(即cDPO)有效且实用。我们的研究结果凸显了利用关键token来降低推理任务中的错误率的潜力,推动了具备鲁棒逻辑推演能力的AI系统的发展。我们的代码、标注数据集和训练好的模型已在https://github.com/chenzhiling9954/Critical-Tokens-Matter 上提供,以支持和鼓励未来在这一前景广阔的领域进行研究。

关键词

引用

@article{arxiv.2411.19943,
  title  = {Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability},
  author = {Zicheng Lin and Tian Liang and Jiahao Xu and Qiuzhi Lin and Xing Wang and Ruilin Luo and Chufan Shi and Siheng Li and Yujiu Yang and Zhaopeng Tu},
  journal= {arXiv preprint arXiv:2411.19943},
  year   = {2025}
}

备注

Work in progress