中文

RT-LA-VocE:低信噪比下实时音视频语音增强

声音 2024-07-11 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

本文旨在从直播视频流和噪声音频流中逐帧生成干净语音,而无需依赖未来输入。为此,我们提出 RT-LA-VocE,彻底重新设计了 LA-VocE 的所有组件——该模型是当前领域的非因果音视频语音增强模型,以实现基于 40ms 输入帧的因果实时推断。我们通过设计仅依赖过去帧的新的视觉和音频编码器,替换 Transformer 编码器为 Emformer,并设计新的因果神经声码器 C-HiFi-GAN。我们在流行的 AVSpeech 数据集上展示,我们的算法在所有实时场景下均取得最先进的成绩。更重要的是,每个组件都经过精心调校,以将算法延迟降至理论最小值 (40ms),同时维持端到端处理延迟仅为每帧 28.15ms,实现最小延迟的逐帧实时增强。

关键词

引用

@article{arxiv.2407.07825,
  title  = {RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement},
  author = {Honglie Chen and Rodrigo Mira and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2407.07825},
  year   = {2024}
}

备注

Interspeech 2024