中文

当策略熵约束失败时:通过感知熵保持流基 RLHF 中的多样性

计算机视觉与模式识别 2026-05-13 v1

摘要

RLHF 被广泛用于与人类偏好一致化流匹配文本到图像模型,但微调后常导致严重的多样性崩溃。在 RL 中,人们常假设多样性与策略熵相关,因而采用熵正则化。然而,我们表明这种直觉在流模型中不成立:策略熵保持不变,尽管感知多样性崩溃。我们从理论和实证角度解释了这一不匹配:常数熵源于固定的预定义噪声计划,而多样性崩溃由策略梯度的模式寻求性驱动。结果,策略熵无法防止模型在感知空间中收敛到狭窄的高奖励区域。为此,我们引入感知熵以捕捉感知空间中的多样性,同时保持标准熵的性质。基于此洞察,我们提出两种熵正则化策略:感知熵约束和对生成空间的感知约束,以保持感知多样性并提高质量。实验在两个基模型、三个感知空间以及神经网络和基于规则的奖励函数下均显示出质量-多样性权衡的一致性提升;PEC 获得了0.734的最佳总体分数(相对于基线的0.366);PEC 的另一互补设置进一步达到0.989的多样性平均值(相对于基线的0.047)。我们的项目页面(https://xiaofeng-tan.github.io/projects/PEC)已公开。

关键词

引用

@article{arxiv.2605.12112,
  title  = {When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy},
  author = {Xiaofeng Tan and Jun Liu and Bin-Bin Gao and Yuanting Fan and Xi Jiang and Chengjie Wang and Hongsong Wang and Feng Zheng},
  journal= {arXiv preprint arXiv:2605.12112},
  year   = {2026}
}