无声的提示:大语言模型推理中无确认的准确性
计算与语言
2025-10-15 v2
摘要
大语言模型(LLMs)越来越依赖思维链(CoT)提示来解决数学和逻辑推理任务。然而,一个核心问题依然存在:这些生成的推理过程在多大程度上忠实于底层的计算,而非由嵌入提示中充当答案捷径的提示所塑造的事后叙述?继先前关于有提示与无提示提示的研究,我们对受控提示操纵下的思维链忠实性进行了系统性研究。我们的实验设计涵盖四个数据集(AIME、GSM-Hard、MATH-500、UniADILR)、两个最先进的模型(GPT-4o 和 Gemini-2-Flash),以及一组在正确性(正确和错误)、呈现风格(谄媚和数据泄露)和复杂性(原始答案、双运算符表达式、四运算符表达式)上有所变化的提示条件。我们评估了任务准确率以及提示是否在推理中被明确确认。我们的结果揭示了三个关键发现。首先,正确的提示显著提高了准确率,尤其是在更难的基准测试和逻辑推理上,而错误的提示则在基线能力较低的任务中急剧降低了准确率。其次,对提示的确认非常不均衡:基于方程的提示经常被引用,而原始提示则常常被无声地采纳,这表明更复杂的提示会推动模型在推理过程中口头表达其依赖。第三,呈现风格很重要:谄媚式提示鼓励公开确认,而泄露式提示则提高了准确率但促进了隐性依赖。这可能反映了基于人类反馈的强化学习(RLHF)相关效应,因为谄媚利用了取悦人类的一面,而数据泄露触发了自我审查的一面。总之,这些结果表明,大语言模型的推理被捷径系统性地塑造,从而模糊了忠实性。
引用
@article{arxiv.2509.26041,
title = {Unspoken Hints: Accuracy Without Acknowledgement in LLM Reasoning},
author = {Arash Marioriyad and Shaygan Adim and Nima Alighardashi and Mahdieh Soleymani Banghshah and Mohammad Hossein Rohban},
journal= {arXiv preprint arXiv:2509.26041},
year = {2025}
}
备注
5 Pages, 4 Figures, 4 Tables