中文

ERNIE-ViLG 2.0:利用知识增强的混合去噪专家改进文本到图像扩散模型

计算机视觉与模式识别 2023-03-29 v2 人工智能

摘要

扩散模型的最新进展彻底改变了文本到图像生成这一流行技术。尽管现有方法能够根据文本条件生成逼真的高分辨率图像,但仍存在若干待解决的开放问题,限制了图像保真度和文本相关性的进一步提升。在本文中,我们提出了 ERNIE-ViLG 2.0,一个大规模的中文文本到图像扩散模型,通过以下方式逐步提升生成图像的质量:(1) 融入场景中关键元素的细粒度文本和视觉知识,以及 (2) 在不同的去噪阶段利用不同的去噪专家。凭借所提出的机制,ERNIE-ViLG 2.0 不仅在 MS-COCO 上以 6.75 的零样本 FID 分数达到了新的最优水平,而且在双语提示集 ViLG-300 上进行的人工并行评估中,在图像保真度和图文对齐方面显著优于近期模型。

关键词

引用

@article{arxiv.2210.15257,
  title  = {ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts},
  author = {Zhida Feng and Zhenyu Zhang and Xintong Yu and Yewei Fang and Lanxin Li and Xuyi Chen and Yuxiang Lu and Jiaxiang Liu and Weichong Yin and Shikun Feng and Yu Sun and Li Chen and Hao Tian and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2210.15257},
  year   = {2023}
}

备注

Accepted to CVPR 2023, highlight. Project page: https://wenxin.baidu.com/ernie-vilg