用于动画化 styled video portrait 的嵌入表示学习网络
计算机视觉与模式识别
2024-05-01 v1 人工智能
摘要
说话头生成最近因其广泛的应用前景而引起广泛关注,尤其是用于数字化像征和 3D 动画设计。受到这一实际需求的驱动,several 作品探索了基于神经辐射场 (NeRF) 来合成说话头。然而,这些基于 NeRF 的方法面临两个挑战:(1) 生成可控 style 的说话头的困难;(2) 渲染图像中颈部区域出现位移伪影。为克服这两个挑战,我们提出了一种新型生成范式嵌入表示学习网络 (ERLNet),包含两个学习阶段。首先,构建了 audio-driven FLAME (ADF) 模块,用于产生与内容音频和 style video 同步的面部表情和头部姿态序列。其次,给定 ADF 推断的序列,一种新的双分支融合 NeRF (DBF-NeRF) 探索这些内容以渲染最终图像。广泛的经验研究表明,这两个阶段的协同有效地促进了我们的方法能够渲染出比现有算法更真实的说话头。
引用
@article{arxiv.2404.19038,
title = {Embedded Representation Learning Network for Animating Styled Video Portrait},
author = {Tianyong Wang and Xiangyu Liang and Wangguandong Zheng and Dan Niu and Haifeng Xia and Siyu Xia},
journal= {arXiv preprint arXiv:2404.19038},
year = {2024}
}