中文

LokiTalk:用于增强NeRF基准说话人 synthesis 的学习细粒度和可泛化对应关系

计算机视觉与模式识别 2024-12-24 v2 机器学习

摘要

尽管自Neural Radiance Fields(NeRF)引入以来,说话人合成取得了显著进展,但仍存在视觉瑕疵和高训练成本作为大规模商业采用的主要障碍。我们提出,通过识别和建立驱动信号与生成结果之间的细粒度且可泛化对应关系,可以同时解决这两个问题。我们present LokiTalk,一个新型框架,旨在增强NeRF基准说话人的面部动态和训练效率。为实现细粒度对应关系,我们引入区域特定变形场,将整体人物运动分解为唇部运动、眨眼、头部姿态和躯干运动。通过两个级联变形场对驱动信号及其关联区域进行分层建模,我们显著提高了动态精度并最小化合成瑕疵。此外,我们提出ID感知知识迁移,一个即插即用模块,从多身份视频中学习可泛化的动态和静态对应关系,同时提取身份特定的动态和静态特征,以改进对个体人物的描绘。全面评估表明,LokiTalk在提供卓越的高保真度结果和训练效率方面优于先前方法。代码将在接受后公开。

关键词

引用

@article{arxiv.2411.19525,
  title  = {LokiTalk: Learning Fine-Grained and Generalizable Correspondences to Enhance NeRF-based Talking Head Synthesis},
  author = {Tianqi Li and Ruobing Zheng and Bonan Li and Zicheng Zhang and Meng Wang and Jingdong Chen and Ming Yang},
  journal= {arXiv preprint arXiv:2411.19525},
  year   = {2024}
}

备注

Project Page: https://digital-avatar.github.io/ai/LokiTalk/