基于DINO语义引导的可变形单次人脸风格化
计算机视觉与模式识别
2024-03-05 v2
摘要
本文解决了单次人脸风格化的复杂问题,重点关注外观和结构的同步考虑,而先前的方法在这方面存在不足。我们探索了变形感知的人脸风格化,它不同于传统的单图像风格参考,而是采用真实-风格图像对。我们方法的核心是利用自监督视觉变换器,特别是DINO-ViT,在真实域和风格域之间建立稳健且一致的面部结构表示。我们的风格化过程首先通过集成空间变换器(STN)使StyleGAN生成器具有变形感知能力。然后,我们在DINO语义引导下引入了两种用于生成器微调的新颖约束:i) 方向变形损失,用于调节DINO空间中的方向向量;ii) 基于DINO令牌自相似性的相对结构一致性约束,确保多样化的生成。此外,采用风格混合来使颜色生成与参考对齐,最小化不一致的对应关系。该框架为通用单次人脸风格化提供了增强的变形能力,微调时间约10分钟,效率显著。大量的定性和定量比较表明,我们优于最先进的单次人脸风格化方法。代码可在https://github.com/zichongc/DoesFS获取。
引用
@article{arxiv.2403.00459,
title = {Deformable One-shot Face Stylization via DINO Semantic Guidance},
author = {Yang Zhou and Zichong Chen and Hui Huang},
journal= {arXiv preprint arXiv:2403.00459},
year = {2024}
}
备注
Accepted to CVPR 2024. Project page: https://github.com/zichongc/DoesFS