RT-LA-VocE:低信噪比下实时音视频语音增强
声音
2024-07-11 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
本文旨在从直播视频流和噪声音频流中逐帧生成干净语音,而无需依赖未来输入。为此,我们提出 RT-LA-VocE,彻底重新设计了 LA-VocE 的所有组件——该模型是当前领域的非因果音视频语音增强模型,以实现基于 40ms 输入帧的因果实时推断。我们通过设计仅依赖过去帧的新的视觉和音频编码器,替换 Transformer 编码器为 Emformer,并设计新的因果神经声码器 C-HiFi-GAN。我们在流行的 AVSpeech 数据集上展示,我们的算法在所有实时场景下均取得最先进的成绩。更重要的是,每个组件都经过精心调校,以将算法延迟降至理论最小值 (40ms),同时维持端到端处理延迟仅为每帧 28.15ms,实现最小延迟的逐帧实时增强。
引用
@article{arxiv.2407.07825,
title = {RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement},
author = {Honglie Chen and Rodrigo Mira and Stavros Petridis and Maja Pantic},
journal= {arXiv preprint arXiv:2407.07825},
year = {2024}
}
备注
Interspeech 2024