Agentic-R1:蒸馏式双策略推理
计算与语言
2025-09-03 v2 人工智能
机器学习
摘要
当前的长思维链(long-CoT)模型在数学推理方面表现出色,但依赖于缓慢且易错的自然语言轨迹。工具增强型智能体通过代码执行解决算术问题,但在复杂逻辑任务上常常表现不佳。我们引入了一个微调框架DualDistill,该框架从多个教师模型中蒸馏互补的推理策略到一个统一的学生模型中。使用这种方法,我们训练了Agentic-R1,它能够为每个查询动态选择最优策略:对算术和算法问题调用工具,对抽象问题使用基于文本的推理。我们的方法在包括计算密集型任务和标准基准在内的各种任务上提高了准确性,证明了多策略蒸馏在实现稳健高效推理方面的有效性。我们的项目可在https://github.com/StigLidu/DualDistill获取。
引用
@article{arxiv.2507.05707,
title = {Agentic-R1: Distilled Dual-Strategy Reasoning},
author = {Weihua Du and Pranjal Aggarwal and Sean Welleck and Yiming Yang},
journal= {arXiv preprint arXiv:2507.05707},
year = {2025}
}
备注
Accepted by EMNLP 2025. 15 pages. Project available at https://github.com/StigLidu/DualDistill