ARM:自适应推理模型
计算与语言
2025-10-14 v2
摘要
尽管大型推理模型在复杂任务上表现出色,但它们缺乏根据任务难度调整推理 token 使用量的能力。这通常会导致“过度思考”问题——即过度且不必要的推理——尽管可以通过人工干预控制 token 预算来缓解,但这仍然从根本上违背了实现完全自主 AI 的目标。在本工作中,我们提出了自适应推理模型(Adaptive Reasoning Model, ARM),这是一种能够根据手头任务自适应选择合适推理格式的推理模型。这些格式包括三种高效格式——直接回答、简短思维链和代码——以及一种更复杂的格式,长思维链。为了训练 ARM,我们引入了 Ada-GRPO,即群体相对策略优化(GRPO)的一种改进版本,用于解决传统 GRPO 中的格式坍缩问题。Ada-GRPO 使 ARM 能够实现高 token 效率,在保持与仅依赖长思维链的模型性能相当的同时,平均减少 30%、最高减少 70% 的 token。此外,它不仅通过减少 token 生成来提高推理效率,还带来了 2 倍的训练加速。除了默认的自适应模式外,ARM 还支持两种额外的推理模式:1) 指令引导模式,允许用户通过特殊 token 明确指定推理格式——当一批任务的合适格式已知时非常理想。2) 共识引导模式,聚合三种高效格式的输出,并在出现分歧时诉诸长思维链,以更高的 token 使用量优先保证性能。
引用
@article{arxiv.2505.20258,
title = {ARM: Adaptive Reasoning Model},
author = {Siye Wu and Jian Xie and Yikai Zhang and Aili Chen and Kai Zhang and Yu Su and Yanghua Xiao},
journal= {arXiv preprint arXiv:2505.20258},
year = {2025}
}
备注
NeurIPS 2025 (Spotlight)