GroupDiff:基于扩散模型的群像编辑
计算机视觉与模式识别
2024-09-24 v1
摘要
群像编辑备受用户期待,因为用户经常希望添加、删除或操纵其中的人物。由于人际互动的复杂动态和多样的姿势,这也极具挑战性。在这项工作中,我们提出了 GroupDiff,这是利用三项专门贡献来解决群像照片编辑的先驱性尝试:1) 数据引擎:由于群像照片编辑缺乏标注数据,我们创建了一个数据引擎来生成用于训练的成对数据。该训练数据引擎涵盖了群像编辑的多样化需求。2) 外观保持:为了在编辑后保持外观一致,我们将群像照片中的人物图像注入注意力模块,并采用骨架提供人物内部引导。3) 控制灵活性:使用指示每个人位置的边界框来重新加权注意力矩阵,以便将每个人的特征注入到正确的位置。这种人物间引导为操纵提供了灵活的方式。大量实验表明,与现有方法相比,GroupDiff 展现出了最先进的性能。GroupDiff 为编辑提供了可控性,并保持了原始照片的保真度。
引用
@article{arxiv.2409.14379,
title = {GroupDiff: Diffusion-based Group Portrait Editing},
author = {Yuming Jiang and Nanxuan Zhao and Qing Liu and Krishna Kumar Singh and Shuai Yang and Chen Change Loy and Ziwei Liu},
journal= {arXiv preprint arXiv:2409.14379},
year = {2024}
}
备注
ECCV 2024