中文

通过抑制大推理模型中的自我确认反思实现高效推理

计算与语言 2025-06-17 v1 人工智能

摘要

尽管近期大推理模型的进展展示了显著的性能,但由于输出长度的快速增长,高效推理仍然至关重要。现有的优化方法强调了'过度思考'的趋势,但缺乏细粒度分析。在本工作中,我们聚焦于自我确认反思:确认先前内容的冗余反思步骤,通常发生在已经正确的推理步骤之后。对原始和优化推理模型的观察揭示了普遍存在的自我确认反思。值得注意的是,这些反思有时导致优化模型的输出比其原始对应模型更长。通过详细分析,我们发现了一个有趣的模式:与其他反思相比,自我确认反思中的引导词(即句子的第一个词)表现出明显的概率偏差。受此洞察启发,我们可以定位自我确认反思并进行无训练实验,证明抑制自我确认反思可以在多个模型(R1-Distill-Models、QwQ-32B和Qwen3-32B)上减少输出长度而不降低准确率。此外,我们通过明确抑制此类反思改进了当前的基于训练的方法。在我们的实验中,我们在无训练设置下实现了18.7%的长度压缩,在基于训练的设置下对R1-Distill-Qwen-1.5B实现了50.2%的长度压缩。此外,我们的改进简单而实用,可以直接应用于现有的推理框架,如vLLM。我们相信我们的发现将为实现更精确的长度压缩和步骤级高效推理提供社区见解。

关键词

引用

@article{arxiv.2506.12353,
  title  = {Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models},
  author = {Kaiyuan Liu and Chen Shen and Zhanwei Zhang and Junjie Liu and Xiaosong Yuan and Jieping ye},
  journal= {arXiv preprint arXiv:2506.12353},
  year   = {2025}
}

备注

Under review