中文

MJ-Bench:你的多模态奖励模型真的是文本到图像生成的好裁判吗?

计算机视觉与模式识别 2024-07-09 v1 计算与语言 机器学习

摘要

虽然像DALLE-3和Stable Diffusion这样的文本到图像模型正在迅速普及,但它们经常遇到幻觉、偏见以及产生不安全、低质量输出等挑战。为了有效解决这些问题,基于多模态裁判的反馈来对齐这些模型与期望行为至关重要。尽管意义重大,但当前的多模态裁判对其能力和局限性的评估往往不足,可能导致对齐失败和不安全的微调结果。为了解决这个问题,我们引入了MJ-Bench,这是一个新颖的基准,它包含一个全面的偏好数据集,用于评估多模态裁判在四个关键方面为图像生成模型提供反馈的能力:对齐性、安全性、图像质量和偏见。具体来说,我们在偏好数据集的每个分解子类别上评估了多种多模态裁判,包括较小规模的基于CLIP的评分模型、开源VLM(例如LLaVA系列)和闭源VLM(例如GPT-4o、Claude 3)。实验表明,闭源VLM通常能提供更好的反馈,其中GPT-4o在平均表现上优于其他裁判。与开源VLM相比,较小规模的评分模型在文本-图像对齐和图像质量方面能提供更好的反馈,而VLM由于其更强的推理能力,在安全性和生成偏见方面能提供更准确的反馈。关于反馈尺度的进一步研究表明,VLM裁判通常能以自然语言(李克特量表)提供比数值尺度更准确和稳定的反馈。值得注意的是,使用来自这些多模态裁判的单独反馈对端到端微调模型进行的人工评估得出了相似的结论,进一步证实了MJ-Bench的有效性。所有数据、代码和模型均可在https://huggingface.co/MJ-Bench获取。

关键词

引用

@article{arxiv.2407.04842,
  title  = {MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?},
  author = {Zhaorun Chen and Yichao Du and Zichen Wen and Yiyang Zhou and Chenhang Cui and Zhenzhen Weng and Haoqin Tu and Chaoqi Wang and Zhengwei Tong and Qinglan Huang and Canyu Chen and Qinghao Ye and Zhihong Zhu and Yuqing Zhang and Jiawei Zhou and Zhuokai Zhao and Rafael Rafailov and Chelsea Finn and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2407.04842},
  year   = {2024}
}

备注

42 pages, 13 figures, 33 tables