中文

先觉知,后少思:动态边界自我觉知驱动大语言模型的极致推理效率

计算与语言 2025-08-18 v1 人工智能

摘要

大语言模型(LLM)的最新进展通过长思维链(CoT)极大地提升了它们在复杂推理任务上的能力。然而,这种方法常常导致大量冗余,损害计算效率,并在实时应用中造成显著延迟。为了提高效率,当前方法通常依赖人工定义的难度先验,这与LLM的自我觉知难度不一致,导致效率低下。在本文中,我们介绍了动态推理边界自我觉知框架(DR. SAF),该框架使模型能够根据问题复杂性动态评估和调整其推理深度。DR. SAF 整合了三个关键组件:边界自我觉知对齐、自适应奖励管理和边界保持机制。这些组件使模型能够优化其推理过程,在不牺牲性能的情况下平衡效率和准确性。我们的实验结果表明,DR. SAF 在精度损失极小的情况下,总响应令牌数减少了 49.27%。该框架还实现了 6.59 倍的令牌效率提升和 5 倍的训练时间缩减,使其非常适合资源受限的环境。在极端训练期间,DR. SAF 在令牌效率上甚至可以超过传统的基于指令的模型,同时准确率提升超过 16%。

关键词

引用

@article{arxiv.2508.11582,
  title  = {Aware First, Think Less: Dynamic Boundary Self-Awareness Drives Extreme Reasoning Efficiency in Large Language Models},
  author = {Qiguang Chen and Dengyun Peng and Jinhao Liu and HuiKang Su and Jiannan Guan and Libo Qin and Wanxiang Che},
  journal= {arXiv preprint arXiv:2508.11582},
  year   = {2025}
}

备注

Preprint