面向人像图像动画的深度与外观联合学习
计算机视觉与模式识别
2025-01-16 v1 机器学习
摘要
2D 人像动画近年来取得了显著进展。大量研究利用嵌入在大型生成扩散模型中的先验知识来增强高质量图像操控。然而,大多数方法仅关注将 RGB 图像作为输出,而对一致的视觉加 3D 输出的联合生成仍 largely 未被探索。在本工作中,我们提出要同时学习视觉外观和深度,以实现基于扩散的人像图像生成器。我们的方法拥抱端到端的扩散范式,并引入一种适用于学习此条件联合分布的新型架构,包括参考网络和通道扩展的扩散主干网络。一旦训练完成,我们的框架可以有效地适应各种下游应用,如人脸深度转图像和图像转深度生成、人像光照重新定位以及具有一致 3D 输出的音频驱动说话人动画。
引用
@article{arxiv.2501.08649,
title = {Joint Learning of Depth and Appearance for Portrait Image Animation},
author = {Xinya Ji and Gaspard Zoss and Prashanth Chandran and Lingchen Yang and Xun Cao and Barbara Solenthaler and Derek Bradley},
journal= {arXiv preprint arXiv:2501.08649},
year = {2025}
}