中文

从伤害到帮助:将推理式少样本演示转化为推理大语言模型的资产

计算与语言 2025-09-30 v1

摘要

近期的推理大语言模型(RLM),尤其是使用基于验证器的强化学习训练的模型,在少样本链式思考(CoT)时往往不如直接回答。我们使用来自DeepSeek-R1的高质量推理痕迹重新审视这一悖论,发现即使演示最优,增加更多示例也一致导致准确率下降。详细分析揭示了这种下降的两种机制:(i)语义误导,高文本相似性导致模型将目标问题视为与演示相同,进而逐字复制中间步骤;(ii)策略转移失败,模型难以提取有用的推理策略并将其应用于目标问题。基于这些发现,我们引入Insight-to-Solve(I2S),一个顺序测试时 procedure,将演示转化为显式、可重用的见解,并推导出针对目标的特定推理痕迹;可选地,对推理进行自我优化以提高连贯性和正确性(I2S+)。广泛的实验表明,I2S和I2S+在各种基准测试上 consistently 优于直接回答和测试时扩展基线。即使针对GPT模型,本方法也有效:在AIME'25上,GPT-4.1提升+14.0%,o1-mini在AIME上提升+2.7%,在GPQA上提升+1.7%,表明通过见解-优化-解题框架可以有效地利用上下文中的少样本演示。

关键词

引用

@article{arxiv.2509.23196,
  title  = {From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs},
  author = {Haonan Wang and Weida Liang and Zihang Fu and Nie Zheng and Yifan Zhang and Yao Tong and Tongyao Zhu and Hao Jiang and Chuang Li and Jiaying Wu and Kenji Kawaguchi},
  journal= {arXiv preprint arXiv:2509.23196},
  year   = {2025}
}