通过自导自盼解锁遮蔽生成模型在图像合成中的能力
计算机视觉与模式识别
2024-10-18 v1
摘要
遮蔽生成模型(Masked Generative Models, MGMs)在生成方面展现出惊人的能力,相较于连续扩散模型在采样步骤上实现了数量级的效率提升。然而,MGMs 在图像合成方面仍不及最近在规模相似的连续扩散模型在样本质量和多样性方面的表现。连续扩散模型性能的关键因素之一源于其引导方法,这些方法在提升样本质量的同时往往以牺牲多样性为代价。本文扩展了这些引导方法,提出一种针对MGMs的通用引导框架化,并提出一种自导自盼采样方法,以实现更好的生成质量。该方法利用辅助任务在向量量化标记空间内进行语义平滑,这类似于连续像素空间中的高斯模糊。配合参数高效微调方法和高温采样,本文提出的自导自盼使MGMs在质量-多样性权衡上取得优异表现,超过了现有的MGMs采样方法,同时实现了更高效的训练和采样成本。多组实验中的各种采样超参数实验确认了本文自导自盼方法的有效性。
引用
@article{arxiv.2410.13136,
title = {Unlocking the Capabilities of Masked Generative Models for Image Synthesis via Self-Guidance},
author = {Jiwan Hur and Dong-Jae Lee and Gyojin Han and Jaehyun Choi and Yunho Jeon and Junmo Kim},
journal= {arXiv preprint arXiv:2410.13136},
year = {2024}
}
备注
NeurIPS 2024. Code is available at: https://github.com/JiwanHur/UnlockMGM