中文

Instruct-NeuralTalker:利用指令编辑音频驱动的说话辐射场

计算机视觉与模式识别 2023-08-17 v2 人工智能

摘要

近期的神经说话辐射场方法在逼真音频驱动说话人脸合成中取得巨大成功。本文提出一种新颖的交互式框架,利用人类指令编辑此类隐式神经表示,以实现实时个性化说话人脸生成。给定一段短语音视频,我们首先构建高效的说话辐射场,然后基于给定指令应用最新的条件扩散模型进行图像编辑,并引导隐式表示优化朝向编辑目标。为保障编辑过程中的音频-嘴唇同步,我们提出一种迭代数据集更新策略,并利用唇边损失约束唇部区域变化。我们还引入轻量细化网络以补充图像细节并在最终渲染图像中实现可控细节生成。我们的方法在消费级硬件上亦可实现高达 30FPS 的实时渲染。多项指标与用户验证表明,相较 SOTA 方法,我们的方法在渲染质量上提供显著提升。

关键词

引用

@article{arxiv.2306.10813,
  title  = {Instruct-NeuralTalker: Editing Audio-Driven Talking Radiance Fields with Instructions},
  author = {Yuqi Sun and Ruian He and Weimin Tan and Bo Yan},
  journal= {arXiv preprint arXiv:2306.10813},
  year   = {2023}
}

备注

11 pages, 8 figures