中文

语义感知的隐式神经音频驱动视频肖像生成

计算机视觉与模式识别 2022-02-11 v1 图形学 机器学习 多媒体 声音 音频与语音处理

摘要

以语音音频驱动高保真视频肖像动画对虚拟现实与数字娱乐至关重要。尽管以往多数研究依赖精确的显式结构信息,近期工作探索神经辐射场 (NeRF) 的隐式场景表示以实现逼真生成。为捕捉人类头部与躯干间的不一致运动及语义差异,部分工作通过两组独立的 NeRF 对它们建模,导致不自然的结果。本工作中,我们提出语义感知说话肖像 NeRF (SSP-NeRF),其使用一组统一的 NeRF 创建精细的音频驱动肖像。所提模型通过两个语义感知模块处理细致的局部面部语义与全局头-躯干关系。具体而言,我们首先提出带有额外解析分支的语义感知动态光线采样模块,以促进音频驱动的体积渲染。此外,为在统一神经辐射场中实现肖像渲染,设计了躯干形变模块以稳定大尺度非刚性躯干运动。大量评估表明,相较先前方法,我们提出的方法渲染出更逼真的视频肖像。项目页面:https://alvinliu0.github.io/projects/SSP-NeRF

关键词

引用

@article{arxiv.2201.07786,
  title  = {Semantic-Aware Implicit Neural Audio-Driven Video Portrait Generation},
  author = {Xian Liu and Yinghao Xu and Qianyi Wu and Hang Zhou and Wayne Wu and Bolei Zhou},
  journal= {arXiv preprint arXiv:2201.07786},
  year   = {2022}
}

备注

12 pages, 3 figures. Project page: https://alvinliu0.github.io/projects/SSP-NeRF