中文

AutoRubric-T2I:面向文本到图像对齐的鲁棒规则化奖励模型

人工智能 2026-05-22 v2 计算机视觉与模式识别 机器学习

摘要

文本到图像 (T2I) 生成模型与人类偏好对齐日益依赖于评估 prompt 对齐性和感知质量的图像奖励模型。现有的奖励模型通常作为基于 Bradley-Terry (BT) 偏好模型在大规模人类偏好语料上训练,导致训练成本高、难以调整且评估标准不透明。而视觉语言模型 (VLM) 裁判可以通过文本评分规则提供更细粒度的评估,但其人工设计或启发式生成的评分规则可能无法可靠反映人类偏好。本文提出 AutoRubric-T2I,是 T2I 领域首个自动合成和选择显式评分规则以指导 VLM 裁判的评分学习框架。AutoRubric-T2I 首先从偏好对中合成推理痕迹以生成候选评分规则,然后使用 VLM 裁判对每条评分规则下的配对图像进行评分,产生偏好学习的配对评分差异。为消除噪声和冗余规则,我们进一步采用 1\ell_1 正则化逻辑回归精炼器,筛选出最具判别性的 Top-NN 条评分规则。广泛的评估表明,AutoRubric-T2I 使用不足 0.01% 标注偏好数据即可产生高质量、可解释的奖励信号,显著减少了大规模奖励模型训练的需求。在图像奖励基准如 MMRB2 上,AutoRubric-T2I 在强大的奖励模型基线上取得了优异成绩。我们进一步验证了 AutoRubric-T2I 在下游 T2I 任务中的 RL 奖励应用,包括 TIIF 和 UniGenBench++,在扩散模型上使用 Flow-GRPO pipeline 时,其生成质量优于标量奖励模型。

关键词

引用

@article{arxiv.2605.17602,
  title  = {AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment},
  author = {Kuei-Chun Kao and Daixuan Huo and Yuanhao Ban and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:2605.17602},
  year   = {2026}
}

备注

27 pages