通过对多项选择问答可解性建模提升过程正确的 CoT 推理
人工智能
2025-10-01 v1 计算与语言
摘要
大型语言模型的推理质量不仅取决于产生正确的答案,还取决于生成有效的中间步骤。我们通过多项选择问答 (MCQA) 来研究这一点,它提供了一个具有固定答案选项的受控环境。我们的分析表明,当问题对模型而言实际上是无法解决的时,更容易出现虚假的思维链,从而导致假阳性。通过估计每个问题的可解性,我们揭示了一个学习最有效的中间区间。基于这一洞察,我们调整了结果监督奖励模型和具有组相对优势的强化学习,以将可解性纳入其目标中。在数学和多模态数据集上的实验中,这些修改持续地产生更高比率的过程正确推理,并且在强化学习中还提高了答案准确性。我们的结果强调,可解性是减少 CoT 推理中幻觉和提高可靠性的关键因素。
引用
@article{arxiv.2509.25941,
title = {Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA},
author = {Raphael Schumann and Stefan Riezler},
journal= {arXiv preprint arXiv:2509.25941},
year = {2025}
}