中文

预训练数据中的轻微损坏可提升扩散模型性能

计算机视觉与模式识别 2024-10-31 v2 人工智能 机器学习

摘要

扩散模型(DMs)在生成逼真的高质量图像、音频和视频方面显示出惊人的能力。它们能够从大规模数据集中受益,包括带有成对数据和条件的网络爬虫数据,如图像-文本和图像-类别配对。尽管经过严格的筛选,这些预训练数据集通常不可避免地包含条件无法准确描述数据的数据的损坏配对。本文首次全面研究了此类预训练数据中损坏对DMs影响。我们对ImageNet-1K和CC3M进行人工损坏,以进行预训练和评估超过50个有条件的DMs。我们的经验发现,预训练中各种类型的轻微损坏可显著提升生成图像的质量、多样性和忠实度,无论是在预训练期间还是下游适应阶段。从理论上讲,我们考虑高斯混合模型并证明,条件中的轻微损坏导致更高的熵,并将损坏训练的DMs生成的数据分布与真实数据分布之间的2-Wasserstein距离缩小。借鉴我们的分析,我们提出一种简单方法来提高在实际数据集上训练DMs的性能,通过添加条件嵌入扰动(CEP)。CEP在预训练和下游任务中显著提高了各种DMs的性能。我们希望我们的研究提供新的见解,以理解DMs及所有模型的预训练过程。

关键词

引用

@article{arxiv.2405.20494,
  title  = {Slight Corruption in Pre-training Data Makes Better Diffusion Models},
  author = {Hao Chen and Yujin Han and Diganta Misra and Xiang Li and Kai Hu and Difan Zou and Masashi Sugiyama and Jindong Wang and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2405.20494},
  year   = {2024}
}

备注

NeurIPS 2024 Spotlight