中文

面向高质量图像生成的奖励模型增强:超越文本-图像对齐

计算机视觉与模式识别 2025-07-28 v1

摘要

当代图像生成系统在保真度与美学质量上已超越基本的文本-图像对齐。然而,现有评估框架未能与之同步演进。本研究表明,基于 CLIP 与 BLIP 架构微调的人类偏好奖励模型存在固有缺陷:它们会对细节丰富且美学价值高的图像不恰当地赋予低分,与真实人类审美偏好产生显著偏差。为解决该问题,我们设计了一种新颖的评估分数——ICT(Image-Contained-Text)分数,通过评估图像表征文本内容的程度来实现并超越文本-图像对齐的目标。在此基础上,我们进一步仅使用图像模态训练了一个 HP(High-Preference)分数模型,在保持文本-图像对齐的同时增强图像美学与细节质量。实验表明,所提评估模型相较现有方法将评分准确率提升超过 10%,并在优化 state-of-the-art 的文生图模型方面取得显著成果。本研究为图像生成技术向更高阶人类审美偏好的演进提供了理论与实证支持。代码已开源:https://github.com/BarretBa/ICTHP。

关键词

引用

@article{arxiv.2507.19002,
  title  = {Enhancing Reward Models for High-quality Image Generation: Beyond Text-Image Alignment},
  author = {Ying Ba and Tianyu Zhang and Yalong Bai and Wenyi Mo and Tao Liang and Bing Su and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2507.19002},
  year   = {2025}
}

备注

Accepted to ICCV 2025