中文

Emu:利用海量数据中的精美针尖增强图像生成模型

计算机视觉与模式识别 2023-09-28 v1

摘要

利用网络规模的图文对训练文本到图像模型,能够从文本生成广泛的视觉概念。然而,这些预训练模型在生成极具美感的图像时常常面临挑战。这催生了预训练后美学对齐的需求。在本文中,我们提出质量微调(quality-tuning),以有效引导预训练模型专门生成高度视觉吸引力的图像,同时保持跨视觉概念的通用性。我们的核心洞见是:用一组数量惊人地少但极具视觉吸引力的图像进行监督微调,可显著提升生成质量。我们在 1.11.1 十亿图文对上预训练了一个隐扩散模型,并仅用数千张精心筛选的高质量图像对其进行微调。所得模型 Emu 相较仅预训练的对应模型取得了 82.9%82.9\% 的胜率。相较于最先进的 SDXLv1.0,在标准 PartiPrompts 与基于文本到图像模型真实使用的我们的 Open User Input 基准上,Emu 在视觉吸引力上分别被偏好 68.4%68.4\%71.3%71.3\% 的次数。此外,我们表明质量微调是一种通用方法,对其他架构同样有效,包括像素扩散与掩码生成式 transformer 模型。

关键词

引用

@article{arxiv.2309.15807,
  title  = {Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack},
  author = {Xiaoliang Dai and Ji Hou and Chih-Yao Ma and Sam Tsai and Jialiang Wang and Rui Wang and Peizhao Zhang and Simon Vandenhende and Xiaofang Wang and Abhimanyu Dubey and Matthew Yu and Abhishek Kadian and Filip Radenovic and Dhruv Mahajan and Kunpeng Li and Yue Zhao and Vladan Petrovic and Mitesh Kumar Singh and Simran Motwani and Yi Wen and Yiwen Song and Roshan Sumbaly and Vignesh Ramanathan and Zijian He and Peter Vajda and Devi Parikh},
  journal= {arXiv preprint arXiv:2309.15807},
  year   = {2023}
}