中文

Auto-Rubric as Reward: 从隐式偏好到显式多模态生成标准

人工智能 2026-05-12 v1

摘要

将多模态生成模型与人类偏好对齐需要尊重人类判断构成性、多维结构的奖励信号。现行的RLHF方法将这一结构简化为标量或两两标签,将细腻的偏好压缩为不透明的参数化代理,暴露了对奖励攻击的脆弱性。虽然近期的Rubrics-as-Reward (RaR)方法试图通过显式标准恢复这一结构,但生成同时可靠、可扩展且数据高效的Rubric仍是开放问题。我们引入Auto-Rubric as Reward (ARR)框架,将奖励建模从隐式权重优化转向显式、基于标准的分解。在任何两两比较之前,ARR将VLM内部化的偏好知识外化为特定于提示的Rubric,将整体意图转化为独立可验证的质量维度。这一将隐式偏好结构转化为可检查、可解释约束的转换显著抑制了包括位置偏差在内的评估偏差,使其能够在零样本部署和少量监督条件下运行。为将这些收益延续到生成训练中,我们提出Rubric Policy Optimization (RPO),将ARR的结构化多维评估提炼为稳健的二进制奖励,取代不透明的标量回归为基于Rubric的偏好决策,这在策略梯度上具有稳定性。在文本到图像生成和图像编辑基准测试中,ARR-RPO超越了两两奖励模型和VLM评判家,表明显式地将隐式偏好知识外化为结构化Rubric可实现更可靠、更数据高效的多模态对齐,揭示了瓶颈在于缺乏因式分解的接口,而非知识不足。

关键词

引用

@article{arxiv.2605.08354,
  title  = {Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria},
  author = {Juanxi Tian and Fengyuan Liu and Jiaming Han and Yilei Jiang and Yongliang Wu and Yesheng Liu and Haodong Li and Furong Xu and Wanhua Li},
  journal= {arXiv preprint arXiv:2605.08354},
  year   = {2026}
}

备注

28 pages, 10 figures, 11 tables