因子化组相对策略优化:用于统一候选生成与排序的 F-GRPO
机器学习
2026-05-14 v1
摘要
传统检索管道通过候选检索和重排序两个阶段优化效用,其中排序针对预定义的候选集合进行。大语言模型(LLM)将这一思路拓展为生成过程:给定候选池,LLM 可在单个自回归 pass 中生成子集并对其排序。然而,这种灵活性带来新的优化挑战:模型必须在接收完整排序列表生成后才能获得效用反馈的组合搜索空间中进行搜索。由于该反馈定义在完成序列上,无法区分差异结果是源于未生成相关子集,还是源于未正确排序该子集。这一信用分配空白使得端到端优化不稳定且样本效率低。现有系统通常通过分离候选生成和排序来解决此问题,但这种解耦仍与下游效用不一致,因为排序受限于其接收的候选集合。为弥合这一差距,我们提出一种统一框架,在单个自回归 rollout 中执行两者,并通过因子化组相对策略优化(F-GRPO)端到端进行优化。我们的框架将策略分解为候选生成和排序,共享单个 LLM backbone,联合训练以实现顺序不变的覆盖奖励和位置感知效用奖励。为解决所产生的阶段特定信用分配问题,我们在两个阶段序列级目标中使用独立的组相对优势。跨顺序推荐和多跳问答基准测试中,F-GRPO 在 top-ranked 性能上优于 GRPO 和解耦基线,超越监督方法,在不增加推理时序架构变更的情况下,保持与强大零-shot 重排序器的竞争力。
引用
@article{arxiv.2605.12995,
title = {F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking},
author = {Rohan Surana and Gagan Mundada and Junda Wu and Xintong Li and Yizhu Jiao and Bowen Jin and Sizhe Zhou and Tong Yu and Ritwik Sinha and Jiawei Han and Jingbo Shang and Julian McAuley},
journal= {arXiv preprint arXiv:2605.12995},
year = {2026}
}