中文

Ada-RS:适应性误 rejection 采样用于选择性思考

人工智能 2026-02-24 v1 机器学习

摘要

大型语言模型 (LLM) 正在越来越多地部署在成本和延迟敏感的场景中。虽然链式思考能提高推理能力,但会在简单请求上浪费 token。我们研究了面向使用工具的 LLM 的选择性思考问题,介绍了适应性误 rejection 采样 (Ada-RS),这是一种对算法agnostic 的样本过滤框架,用于学习选择性且高效的推理。对于给定的上下文,Ada-RS 对多个采样完成结果进行评分,使用自适应长度惩罚奖励,然后应用蒙特卡罗 rejection 采样,只保留高奖励的候选结果(或偏好对)以供下游优化使用。我们展示了 Ada-RS 如何集成到偏好对(如 DPO)或分组策略优化(如 DAPO)策略中。使用 Qwen3-8B 配合 LoRA 在合成的工具调用导向电商基准测试上,Ada-RS 在准确率-效率前沿上优于标准算法,通过将平均输出 token 减少最高可达 80%,将思考率减少最高可达 95%,同时保持或提升工具调用准确率。这些结果表明,训练信号的选择是延迟敏感部署中高效推理的强大杠杆。

关键词

引用

@article{arxiv.2602.19519,
  title  = {Ada-RS: Adaptive Rejection Sampling for Selective Thinking},
  author = {Yirou Ge and Yixi Li and Alec Chiu and Shivani Shekhar and Zijie Pan and Avinash Thangali and Yun-Shiuan Chuang and Chaitanya Kulkarni and Uma Kona and Linsey Pang and Prakhar Mehrotra},
  journal= {arXiv preprint arXiv:2602.19519},
  year   = {2026}
}