共识组相对策略优化用于文本生成
机器学习
2026-02-04 v1
摘要
许多强大的文本生成解码方法遵循样本-重排范式:它们抽取多个候选方案,根据效用函数(奖励)对每个方案进行评分,并在样本之间达成共识后返回最佳方案。虽然有效,但这些方法在推理期间因重复抽样和评分而产生高计算成本。先前的尝试通过 amortize 推理计算通常依赖黄金参考、教师标签或精选偏好数据,增加数据构建 effort和对高保真奖励模型的需求。我们提出共识组相对策略优化(C-GRPO),将最小贝叶斯风险(MBR)解码 distilled 到训练中,通过将共识效用形式化为组相对目标于GRPO。C-GRPO仅需效用函数和策略样本,无需黄金参考或显式偏好标签。在理想条件下,我们展示了C-GRPO的目标函数与MBR解码背后期望效用目标的梯度在方向上具有对齐性,导致收敛保证。在机器翻译(WMT 2024)和文本摘要(XSum)上的实验表明,C-GRPO成功地在不及额外推理开销的情况下实现了与MBR解码相当的性能,同时优于无参考基线方法。
引用
@article{arxiv.2602.03102,
title = {Consensus Group Relative Policy Optimization for Text Generation},
author = {Yuki Ichihara and Yuu Jinnai and Kaito Ariu and Eiji Uchibe},
journal= {arXiv preprint arXiv:2602.03102},
year = {2026}
}