MaTe3D:掩码引导的基于文本的 3D 感知人像编辑
计算机视觉与模式识别
2024-07-08 v4
摘要
3D 感知人像编辑在多个领域有着广泛的应用。然而,当前的方法受到限制,因为它们只能执行掩码引导或基于文本的编辑。即使将这两个过程融合到一个模型中,也无法保证编辑质量和稳定性。为了解决这一局限性,我们提出了 \textbf{MaTe3D}:掩码引导的基于文本的 3D 感知人像编辑。在这个框架中,首先,我们引入了一种新的基于 SDF 的 3D 生成器,它通过提出的 SDF 和密度一致性损失学习局部和全局表示。这增强了局部区域中基于掩码的编辑;其次,我们提出了一种新的蒸馏策略:几何与纹理上的条件蒸馏 (CDGT)。与现有的蒸馏策略相比,它减轻了视觉模糊并避免了纹理与几何之间的不匹配,从而在编辑时产生稳定的纹理和令人信服的几何形状。此外,我们创建了 CatMask-HQ 数据集,这是一个大规模高分辨率的猫脸标注数据集,用于探索模型的泛化和扩展。我们在 FFHQ 和 CatMask-HQ 数据集上进行了大量实验,以证明所提出方法的编辑质量和稳定性。我们的方法能够基于修改后的掩码和文本提示忠实地生成 3D 感知的编辑人脸图像。我们的代码和模型将公开发布。
引用
@article{arxiv.2312.06947,
title = {MaTe3D: Mask-guided Text-based 3D-aware Portrait Editing},
author = {Kangneng Zhou and Daiheng Gao and Xuan Wang and Jie Zhang and Peng Zhang and Xusen Sun and Longhao Zhang and Shiqi Yang and Bang Zhang and Liefeng Bo and Yaxing Wang and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2312.06947},
year = {2024}
}
备注
16 pages, 13 figures