中文

多模态 LLM 作为文本到图像生成的定制化奖励模型

计算机视觉与模式识别 2025-07-31 v2 人工智能 计算与语言

摘要

我们提出了 LLaVA-Reward,这是一个高效的奖励模型,旨在利用预训练的多模态大型语言模型(multimodal large language models, MLLMs)自动评估文本到图像(text-to-image, T2I)生成的多个视角。现有的 MLLM 基于方法需要针对监督微调和分析文本响应进行评估,这既耗时又难训练。为解决此问题,我们提出了 LLaVA-Reward,直接利用给定文本-图像对的隐藏状态。为增强解码器-only MLLM 中视觉与文本表示之间的双向交互,我们进一步提出了添加一个跳过连接跨注意力(Skip-connection Cross Attention, SkipCA)模块。该设计通过连接早层视觉特征与后期隐藏表示,增强了文本-图像关联推理。在此基础上,LLaVA-Reward 支持不同类型的偏好数据进行高效微调,包括成对偏好数据和非成对数据。我们在四个评估视角上训练 LLaVA-Reward:文本-图像对齐、保真度/伪影、安全性和整体排序。实证结果表明,LLaVA-Reward 在自动评估和文本到图像生成中的推理时间扩展方面均优于常规和 MLLM-based 方法。

关键词

引用

@article{arxiv.2507.21391,
  title  = {Multimodal LLMs as Customized Reward Models for Text-to-Image Generation},
  author = {Shijie Zhou and Ruiyi Zhang and Huaisheng Zhu and Branislav Kveton and Yufan Zhou and Jiuxiang Gu and Jian Chen and Changyou Chen},
  journal= {arXiv preprint arXiv:2507.21391},
  year   = {2025}
}

备注

Accepted at ICCV 2025. Code available at https://github.com/sjz5202/LLaVA-Reward