中文

TSPO:打破多轮搜索策略优化中的双重同质化困境

人工智能 2026-04-07 v2

摘要

多轮工具集成推理使大型语言模型(LLM)能够通过迭代信息检索来解决复杂任务。然而,当前以稀疏结果级奖励为主的强化学习框架存在“双重同质化困境”:(1)过程同质化,即生成中涉及的思考、推理与工具使用被忽略;(2)内部组同质化,粗粒度的结果奖励常导致基于组相对政策优化(GRPO)等方法在抽样期间的组内优势估计效率低下。为此,我们提出轮级分阶段感知政策优化(TSPO)。TSPO引入首次出现潜在奖励(FOLR)机制,将部分奖励分配到首次出现正确答案的步骤,从而保留过程级信号,同时在不需外部奖励模型或任何标注的情况下提升组内奖励方差。大量实验表明,TSPO显著优于最先进的基线,分别在 Qwen2.5-3B 与 7B 模型上实现了平均性能提升24%与13.6%。代码已公开于 https://github.com/Flipped-May/TSPO。

关键词

引用

@article{arxiv.2601.22776,
  title  = {TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization},
  author = {Shichao Ma and Zhiyuan Ma and Ming Yang and Xiaofan Li and Xing Wu and Jintao Du and Yu Cheng and Weiqiang Wang and Qiliang Liu and Zhengyang Zhou and Yang Wang},
  journal= {arXiv preprint arXiv:2601.22776},
  year   = {2026}
}