中文

用于文本到图像生成的丰富人类反馈

计算机视觉与模式识别 2024-04-10 v2

摘要

最近的文本到图像(T2I)生成模型,如Stable Diffusion和Imagen,在基于文本描述生成高分辨率图像方面取得了显著进展。然而,许多生成的图像仍然存在伪影/不合理、与文本描述不对齐以及审美质量低等问题。受强化学习与人类反馈(RLHF)在大语言模型上成功的启发,先前的工作收集了人类提供的分数作为生成图像的反馈,并训练奖励模型来改进T2I生成。在本文中,我们通过以下方式丰富反馈信号:(i)标记图像中不合理或与文本不对齐的区域,(ii)标注文本提示中哪些词在图像中被错误表示或缺失。我们在18K张生成图像(RichHF-18K)上收集了这种丰富的人类反馈,并训练了一个多模态变换器来自动预测丰富反馈。我们展示了预测的丰富人类反馈可用于改进图像生成,例如,通过选择高质量训练数据来微调和改进生成模型,或通过使用预测热图创建掩码来修复问题区域。值得注意的是,这些改进可以泛化到用于收集人类反馈数据的图像生成模型(Stable Diffusion变体)之外的模型(Muse)。RichHF-18K数据集将在我们的GitHub仓库中发布:https://github.com/google-research/google-research/tree/master/richhf_18k。

关键词

引用

@article{arxiv.2312.10240,
  title  = {Rich Human Feedback for Text-to-Image Generation},
  author = {Youwei Liang and Junfeng He and Gang Li and Peizhao Li and Arseniy Klimovskiy and Nicholas Carolan and Jiao Sun and Jordi Pont-Tuset and Sarah Young and Feng Yang and Junjie Ke and Krishnamurthy Dj Dvijotham and Katie Collins and Yiwen Luo and Yang Li and Kai J Kohlhoff and Deepak Ramachandran and Vidhya Navalpakkam},
  journal= {arXiv preprint arXiv:2312.10240},
  year   = {2024}
}

备注

CVPR'24