中文

AdaReasoner:自适应推理机制提升大语言模型的灵活思考能力

人工智能 2025-10-13 v4 机器学习

摘要

大语言模型常需有效配置(如温度和推理步骤)以处理需要复杂推理与问题解决的任务,涵盖笑话生成至数学推理等。现有提示方法通常采用通用且固定的配置,虽在多数任务上‘足够好’,却少能实现任务特定的最优。为填补这一差距,我们引入AdaReasoner,一个针对任何大语言模型的无关插件,旨在自动为需不同类型思考的任务生成自适应推理配置。AdaReasoner采用强化学习框架进行训练,结合因子化动作空间与针对性探索策略,并利用预训练奖励模型以仅需少量样本即可优化推理配置的策略模型。AdaReasoner具备理论保证,并经实验验证其快速收敛与亚线性策略间隙。跨六种不同大语言模型及多样化推理任务,AdaReasoner持续超越标准基线,保持离分布鲁棒性,并通过量身定制的提示在知识密集型任务中实现提升。

关键词

引用

@article{arxiv.2505.17312,
  title  = {AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models},
  author = {Xiangqi Wang and Yue Huang and Yanbo Wang and Xiaonan Luo and Kehan Guo and Yujun Zhou and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2505.17312},
  year   = {2025}
}