过度思考者的 DIET:通过难度感知训练削减 token 热量
计算与语言
2025-05-27 v1
摘要
近期大型语言模型 (LLM) 展现出惊人的推理能力,但常常过度思考,生成过长的响应导致效率受限。我们提出 DIET (DIfficulty-AwarE Training),一个系统性地通过将问题难度内置于强化学习 (RL) 过程中,以削减这些“token 热量”的框架。DIET 通过调节 token 罚力强度并依据估计任务难度调整目标长度,动态适应 token 压缩策略,以优化性能与效率之间的权衡。我们还对单纯奖励加权在以 GRPO 等组归一化 RL 算法中的陷阱进行了理论分析,并提出 Advantage Weighting 技术,实现难度感知目标的稳定有效执行。实验结果表明,DIET 显著降低 token 数量,同时提升推理性能。超越原始 token 减少,本工作还发现两项关键收益:(1) DIET 带来更优的推理扩展性能。通过维持少量 token 的高质量单样本,使其在固定计算预算下通过多数投票获取更多样本,从而实现更好的扩展性能,其他方法在此方面常常受限。(2) DIET 增强了响应长度与问题难度之间的自然正相关性,确保冗长程度得到恰当分配,不同于许多现有压缩方法会破坏这一关系。我们的分析提供了一个原则且有效的框架,用于开发更高效、更实用且性能更好的 LLM。
引用
@article{arxiv.2505.19217,
title = {The Overthinker's DIET: Cutting Token Calories with DIfficulty-AwarE Training},
author = {Weize Chen and Jiarui Yuan and Tailin Jin and Ning Ding and Huimin Chen and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2505.19217},
year = {2025}
}
备注
under review