面向流模型的嵌入扰动探索偏好优化
计算机视觉与模式识别
2026-05-18 v1 机器学习
摘要
近期进展已将强化学习 (RL) 确立为将生成模型与人类意图对齐的关键范式。然而,基于组的优化框架(例如 GRPO)面临一个关键限制:组内方差的快速衰减。随着组内样本间差异性的减小,方差趋近于零。这消除了优化所需的学习信号,导致过程不稳定,并迫使策略过早停滞或进行奖励黑客行为。现有策略,如改变初始噪声或增加组大小,通常无法解决这一根本问题,导致训练不稳定或收益递减。为克服这些挑战,我们提出了嵌入扰动探索偏好优化 (E²PO),这是一种通过嵌入级扰动维持优化的新颖框架。我们的方法在样本组内引入结构化的嵌入级扰动,保证了稳健的方差,从而在整个训练过程中保留了判别信号。大量实验表明,我们的方法显著优于最先进的基线,实现了与人类偏好更忠实的对齐。
引用
@article{arxiv.2605.15803,
title = {Embedding-perturbed Exploration Preference Optimization for Flow Models},
author = {Sujie Hu and Chubin Chen and Jiashu Zhu and Jiahong Wu and Xiangxiang Chu and Xiu Li},
journal= {arXiv preprint arXiv:2605.15803},
year = {2026}
}
备注
Accepted by ICML 2026