中文

基于双音频感知模态耦合的说话人视频生成

声音 2025-04-01 v1 计算机视觉与模式识别 音频与语音处理

摘要

音频驱动的说话人视频生成是计算机视觉和图形学中的关键挑战,具有虚拟头像和数字媒体等应用前景。传统方法往往难以捕捉音频与面部动态之间复杂的相互作用,导致唇部同步和视觉质量问题。本文提出了一种基于 NeRF 的新型框架——双音频感知模态耦合(Dual Audio-Centric Modality Coupling, DAMC),有效整合音频输入中的内容与动态特征。通过采用双编码器结构,DAMC 通过内容感知编码器(Content-Aware Encoder)捕捉语义内容,通过动态同步编码器(Dynamic-Sync Encoder)确保精准的视觉同步。这些特征通过跨同步融合模块(Cross-Synchronized Fusion Module, CSFM)进行融合,增强内容表征并提升唇部同步。大量实验表明,我们的方法在唇部同步精度和图像质量等关键指标上超越了现有最先进的方法,展现出对各类音频输入(包括来自文本转语音系统的合成语音)的稳健泛化能力。我们的结果为高质量、音频驱动的说话人视频生成提供了可行方案,并呈现了一个可扩展的创造逼真说话人头像的方法。

关键词

引用

@article{arxiv.2503.22728,
  title  = {Dual Audio-Centric Modality Coupling for Talking Head Generation},
  author = {Ao Fu and Ziqi Ni and Yi Zhou},
  journal= {arXiv preprint arXiv:2503.22728},
  year   = {2025}
}

备注

9 pages, 4 figures