中文

ODRPO:离散奖励的序分解用于稳健策略优化

机器学习 2026-05-18 v2 人工智能

摘要

大型语言模型(Large Language Models, LLMs)的对齐利用基于 AI反馈的强化学习(Reinforcement Learning from AI Feedback, RLAIF),用于非可验证领域,如长篇问答和开放式指令遵循。这些领域常依赖基于 LLM 的自动评分器提供细粒度、多层次离散奖励(如 1-10 评分标准),其本质上是随机的,由于提示敏感性和抽样随机性。我们经验性地验证了自动评分器的随机性,这种随机性会传播并损坏诸如 GRPO 和 MaxRL 等标准优势估计器。经验地来说,获取更多奖励样本并采用多数投票可能减少噪声并提升性能,但此方法计算成本高昂。为解决这一瓶颈,我们引入 O\textbf{O}rdinal D\textbf{D}ecomposition for R\textbf{R}obust P\textbf{P}olicy O\textbf{O}ptimization(ODRPO\textbf{ODRPO}),一种结构性地通过将离散奖励分解为一序列序数二元指示器来隔离评估噪声的框架。通过独立计算并累积这些逐步更具挑战性成功阈值的优势,ODRPO 可防止异常评估破坏全局更新,同时建立一种隐式的、方差感知的学习课程。经验地,ODRPO 在 Qwen2.5-7B 和 Qwen3-4B 模型上实现了稳健性能, 在 FACTS-grounding-v2 上实现最高可达 14.8% 的相对提升,在 Alpaca-Evals 上实现 7.5% 的相对提升。关键在于,这些收益是在几乎不增加训练时间开销的前提下实现的,因为 ODRPO 在每个步骤中不需要额外计算。支持其优化稳定性的理论分析表明,ODRPO 提供了一个可扩展且稳健的框架,用于在现代 RLAIF 的噪声、离散评估景观中对模型进行对齐。

关键词

引用

@article{arxiv.2605.12667,
  title  = {ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization},
  author = {Nirmal Patel and Fei Wang and Inderjit S. Dhillon},
  journal= {arXiv preprint arXiv:2605.12667},
  year   = {2026}
}