中文

RESOUND:基于声学-语义解耦建模的静默视频语音重建

声音 2025-05-29 v1 计算机视觉与模式识别 音频与语音处理

摘要

唇语到语音(L2S)合成旨在从视觉线索中重建语音,但由于在捕捉语言内容、口音和韵律方面监督有限,其在准确性和自然度上面临挑战。在本文中,我们提出了 RESOUND,一种新颖的 L2S 系统,能够从静默说话人脸视频中生成可懂且富有表现力的语音。利用源-滤波器理论,我们的方法包含两个组件:用于预测韵律的声学路径和用于提取语言特征的语义路径。这种分离简化了学习过程,允许对每种表示进行独立优化。此外,我们将语音单元(一种被证明有效的无监督语音表示技术)与 mel 频谱图一起整合到波形生成中,从而提升了性能。这使得 RESOUND 能够在保留内容和说话人身份的同时合成具有韵律的语音。在两个标准 L2S 基准上进行的实验证实了所提出方法在各种指标上的有效性。

关键词

引用

@article{arxiv.2505.22024,
  title  = {RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling},
  author = {Long-Khanh Pham and Thanh V. T. Tran and Minh-Tan Pham and Van Nguyen},
  journal= {arXiv preprint arXiv:2505.22024},
  year   = {2025}
}

备注

accepted in Interspeech 2025