用于一致性视觉合成的协同分数蒸馏
计算机视觉与模式识别
2023-07-12 v1 机器学习
摘要
大规模文本到图像扩散模型的生成先验使得在多种视觉模态上实现广泛的生成与编辑应用成为可能。然而,当将这些先验适配到常以多图像(如视频)表示的复杂视觉模态时,在一组图像间实现一致性具有挑战性。在本文中,我们以新方法协同分数蒸馏(CSD)应对该挑战。CSD基于Stein变分梯度下降(SVGD)。具体而言,我们提议将多个样本视为SVGD更新中的“粒子”,并组合它们的分数函数以在一组图像上同步蒸馏生成先验。因此,CSD促进了2D图像间信息的无缝整合,从而实现多样本间一致的视觉合成。我们在多项任务中展示了CSD的有效性,涵盖全景图像、视频和3D场景的视觉编辑。我们的结果凸显了CSD作为增强样本间一致性的通用方法的竞争力,从而拓宽了文本到图像扩散模型的适用性。
引用
@article{arxiv.2307.04787,
title = {Collaborative Score Distillation for Consistent Visual Synthesis},
author = {Subin Kim and Kyungmin Lee and June Suk Choi and Jongheon Jeong and Kihyuk Sohn and Jinwoo Shin},
journal= {arXiv preprint arXiv:2307.04787},
year = {2023}
}
备注
Project page with visuals: https://subin-kim-cv.github.io/CSD/