迈向灵活、可扩展且自适应的多模态条件人脸合成
计算机视觉与模式识别
2024-03-22 v2
摘要
多模态条件人脸合成的最新进展使得创建视觉上引人注目且精确对齐的人脸图像成为可能。然而,当前方法仍面临可扩展性、灵活性有限以及控制强度一刀切的问题,未能考虑不同模态间条件熵(给定条件下数据不可预测性的度量)的不同水平。为应对这些挑战,我们引入了一种新颖的单模态训练方法,结合模态代理和熵感知模态自适应调制,以支持灵活、可扩展且自适应的多模态条件人脸合成网络。我们的单模态训练使用模态代理,仅利用单模态数据,用模态代理装饰条件以赋予模态特定特征,并作为模态间协作的链接器,充分学习人脸合成过程中每种模态的控制以及模态间协作。熵感知模态自适应调制根据模态特定特征和给定条件精细调整扩散噪声,使得在去噪轨迹上迈出信息充分的步骤,最终产生高保真度和高质量的合成结果。我们的框架在各种条件下改进了多模态人脸合成,在图像质量和保真度上超越了当前方法,如我们彻底的实验结果所示。
引用
@article{arxiv.2312.16274,
title = {Towards Flexible, Scalable, and Adaptive Multi-Modal Conditioned Face Synthesis},
author = {Jingjing Ren and Cheng Xu and Haoyu Chen and Xinran Qin and Lei Zhu},
journal= {arXiv preprint arXiv:2312.16274},
year = {2024}
}