中文

拉格朗日优化视角下的简洁推理

人工智能 2025-10-15 v2

摘要

大型语言模型中的简洁推理旨在生成到达最终答案所必需的仅存中间步骤,从而缓解过度思考的问题。大多数已提出的方法依赖于精心策划的启发式方法,难以在简洁性和性能之间取得平衡,常常无法在不同领域和模型规模之间灵活适应。本文通过引入一种原则且实用的策略——性能感知长度更新(PALU)来应对这些挑战。作为一种原则算法,PALU将简洁推理形式化为一个受性能约束的最小化响应长度的约束优化问题,然后应用拉格朗日优化将其转化为可求解的无约束问题。作为一种实用解决方案,PALU通过三种近似方法简化了复杂的更新规则:(i) 使用离策略滚动估计性能,(ii) 将拉格朗日乘子截断为两个极端值,(iii) 用分位数驱动的长度调整取代梯度更新。当应用到 DeepSeek-Distill-Qwen-1.5B 模型时,PALU 在五个基准测试中平均将输出长度缩短 65%,同时提高准确率 15%,优于多种替代方法。进一步地,PALU 在不同领域(逻辑、STEM 和数学)和不同模型规模(1.5B、7B、14B)之间 demonstrate 了其适应性,使该算法成为一种实用且有效的简洁推理方法。

关键词

引用

@article{arxiv.2510.10168,
  title  = {Concise Reasoning in the Lens of Lagrangian Optimization},
  author = {Chengqian Gao and Haonan Li and Taylor W. Killian and Jianshu She and Renxi Wang and Liqun Ma and Zhoujun Cheng and Shibo Hao and Zhiqiang Xu},
  journal= {arXiv preprint arXiv:2510.10168},
  year   = {2025}
}