大语言模型推理因无关上下文而被分散的分析:使用受控基准测试
计算与语言
2025-09-23 v2 人工智能
机器学习
摘要
我们引入了带有干扰性上下文的小学数学题 (GSM-DC),用于评估大语言模型 (LLM) 推理鲁棒性,以系统可控的无关上下文 (IC) 为导向。GSM-DC通过构建符号推理图并进行精确干扰注入,实现严谨、可重复的评估。我们的实验表明,LLM 对 IC 敏感度显著增加,既影响推理路径选择,也影响算术准确性。此外,通过训练带有强干扰项的模型,可在分布内和分布外情景中提升性能。我们进一步提出一种基于过程奖励模型的分步树搜索方法,显著提升了分布外情景下的鲁棒性。
引用
@article{arxiv.2505.18761,
title = {How Is LLM Reasoning Distracted by Irrelevant Context? An Analysis Using a Controlled Benchmark},
author = {Minglai Yang and Ethan Huang and Liang Zhang and Mihai Surdeanu and William Wang and Liangming Pan},
journal= {arXiv preprint arXiv:2505.18761},
year = {2025}
}
备注
19 pages, 10 figures, 5 tables