利用预训练视觉表示的实时视听语音增强
音频与语音处理
2025-08-05 v2 新兴技术
机器学习
摘要
纯音频环境下的语音增强仍然具有挑战性,尤其是在存在干扰说话者的情况下。本文提出了一种简单而有效的实时视听语音增强(AVSE)系统RAVEN,该系统能够隔离并增强屏幕上的目标说话者,同时抑制干扰说话者和背景噪声。我们研究了从视听语音识别(AVSR)和活跃说话者检测(ASD)中学习到的视觉嵌入在不同信噪比条件和干扰说话者数量下对AVSE的贡献。我们的结果表明,在低信噪比、多说话者环境中,拼接来自AVSR和ASD模型的嵌入能带来最大的改进,而在纯噪声场景下,仅使用AVSR嵌入效果最佳。此外,我们开发了一个在计算机CPU上运行的实时流式系统,并提供了视频演示和代码仓库。据我们所知,这是首个开源实现的实时AVSE系统。
引用
@article{arxiv.2507.21448,
title = {Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations},
author = {T. Aleksandra Ma and Sile Yin and Li-Chia Yang and Shuo Zhang},
journal= {arXiv preprint arXiv:2507.21448},
year = {2025}
}
备注
Accepted into Interspeech 2025; corrected author name typo