中文

通过对多项选择问答可解性建模提升过程正确的 CoT 推理

人工智能 2025-10-01 v1 计算与语言

摘要

大型语言模型的推理质量不仅取决于产生正确的答案,还取决于生成有效的中间步骤。我们通过多项选择问答 (MCQA) 来研究这一点,它提供了一个具有固定答案选项的受控环境。我们的分析表明,当问题对模型而言实际上是无法解决的时,更容易出现虚假的思维链,从而导致假阳性。通过估计每个问题的可解性,我们揭示了一个学习最有效的中间区间。基于这一洞察,我们调整了结果监督奖励模型和具有组相对优势的强化学习,以将可解性纳入其目标中。在数学和多模态数据集上的实验中,这些修改持续地产生更高比率的过程正确推理,并且在强化学习中还提高了答案准确性。我们的结果强调,可解性是减少 CoT 推理中幻觉和提高可靠性的关键因素。

关键词

引用

@article{arxiv.2509.25941,
  title  = {Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA},
  author = {Raphael Schumann and Stefan Riezler},
  journal= {arXiv preprint arXiv:2509.25941},
  year   = {2025}
}