多模态大语言模型是面向文本生成图像的人类对齐标注器
计算机视觉与模式识别
2024-04-24 v1 多媒体
摘要
最近的研究表明,利用人类偏好数据集来改进文本生成图像生成模型具有巨大的潜力,能够增强生成图像与文本提示之间的对齐。尽管取得了这些进展,但目前的人类偏好数据集要么构建成本极其高昂,要么在偏好维度上缺乏多样性,导致其在开源文本生成图像生成模型的指令微调中适用性有限,并阻碍了进一步的探索。为了应对这些挑战并通过指令微调促进生成模型的对齐,我们利用多模态大语言模型创建了 VisionPrefer,这是一个高质量、细粒度的偏好数据集,捕获了多个偏好维度。我们从四个方面聚合 AI 标注器的反馈:提示遵循、美学、保真度和无害性,以构建 VisionPrefer。为了验证 VisionPrefer 的有效性,我们在 VisionPrefer 上训练了一个奖励模型 VP-Score 来指导文本生成图像生成模型的训练,并且 VP-Score 的偏好预测准确率与人类标注器相当。此外,我们使用两种强化学习方法对生成模型进行监督微调以评估 VisionPrefer 的性能,广泛的实验结果表明,VisionPrefer 在组合图像生成的多个方面(例如美学)显著提高了文本-图像对齐,并且在各种图像分布上比以前的人类偏好指标具有更好的泛化能力。此外,VisionPrefer 表明,将 AI 生成的合成数据作为监督信号是在视觉生成模型中实现与人类偏好更好对齐的有前途的途径。
引用
@article{arxiv.2404.15100,
title = {Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation},
author = {Xun Wu and Shaohan Huang and Furu Wei},
journal= {arXiv preprint arXiv:2404.15100},
year = {2024}
}