中文

SoliReward:缓解视频生成奖励模型易受奖励黑客和标注噪声影响的方案

机器学习 2026-03-17 v3 计算机视觉与模式识别

摘要

后训练对视频生成模型进行人类偏好对齐是关键目标。但开发有效的奖励模型(RM)面临显著方法论挑战。当前的数据收集范式依赖于基于提示的成对标注,存在标注噪声问题;此外,基于视觉语言模型(VLM)的 RM 架构设计尚未得到充分探讨。进一步,RM 在后训练过程中易受奖励黑客攻击。为缓解这些限制,我们提出 SoliReward,一个系统化的视频 RM 训练框架。该框架首先通过单项二元标注获取高质量且成本效益高的数据,然后采用跨提示配对策略构建偏好对。架构上,我们采用层次化渐进查询注意力机制以增强特征聚合。最后,我们引入修改版 BT 损失,显式容纳胜负平场景。该方法对正样本的得分分布进行正则化,为缓解对少数高分样本的过度关注,提供更细致的偏好信号。我们在评估物理合理性、主体变形和语义对齐的基准上验证了该方法,显示在直接 RM 评估指标以及后训练对视频生成模型的效果方面均取得改进。代码和基准已公开于 https://github.com/lian700/SoliReward。

关键词

引用

@article{arxiv.2512.22170,
  title  = {SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models},
  author = {Jiesong Lian and Ruizhe Zhong and Zixiang Zhou and Xiaoyue Mi and Long Hu and Yuan Zhou and Qinglin Lu and Yixue Hao and Junchi Yan},
  journal= {arXiv preprint arXiv:2512.22170},
  year   = {2026}
}

备注

16 pages, 9 figures