基于多模态生成先验的肖像视频编辑
计算机视觉与模式识别
2024-09-23 v1 图形学
摘要
我们介绍了 PortraitGen,这是一种强大的肖像视频编辑方法,能够实现多模态提示下的一致且富有表现力的风格化。传统的肖像视频编辑方法往往在 3D 和时间一致性方面存在困难,通常在渲染质量和效率方面不足。为此,我们将肖像视频帧提升到统一的动态 3D 高斯场,从而确保跨帧的结构和时间一致性。此外,我们设计了一种新颖的神经高斯纹理机制,不仅实现了复杂的风格编辑,还实现了超过 100FPS 的渲染速度。我们的系统通过从大规模 2D 生成模型中蒸馏知识来整合多模态输入。我们的系统还包含表情相似性指导和面部感知的肖像编辑模块,有效缓解了迭代数据集更新相关的质量下降问题。广泛的实验结果表明,我们的方法在时间一致性、编辑效率和卓越的渲染质量方面均表现优异。通过包括文本驱动编辑、图像驱动编辑和重 lighting 等多种应用,展示了所提出方法的广泛适用性。项目页面提供了演示视频和已发布的代码:https://ustc3dv.github.io/PortraitGen/
引用
@article{arxiv.2409.13591,
title = {Portrait Video Editing Empowered by Multimodal Generative Priors},
author = {Xuan Gao and Haiyao Xiao and Chenglai Zhong and Shimin Hu and Yudong Guo and Juyong Zhang},
journal= {arXiv preprint arXiv:2409.13591},
year = {2024}
}
备注
Accepted by SIGGRAPH Asia 2024. Project Page: https://ustc3dv.github.io/PortraitGen/