中文

面向 CPU 的实时音视频目标语音增强系统 RAVEN

音频与语音处理 2025-09-26 v1 新兴技术 机器学习

摘要

我们展示了 RAVEN(Real-Time Audio-Visual Target speech enhancement)的一个现场演示,这是一个专为在 CPU 上完全运行而设计的实时音视频语音增强系统。在单通道、仅音频的场景中,语音增强传统上被视为从环境噪声中提取干净语音的任务。更近期的研究探索了利用视觉线索(如唇部动作)来提高鲁棒性,尤其是在干扰说话者的环境下。然而,我们所知尚无任何前期工作展示了一个在 CPU 硬件上运行的、用于实时音视频语音增强的交互式系统。RAVEN 通过采用音视频语音识别模型中预训练的视觉嵌入来编码唇部动作信息,从而填补了这一空白。该系统能够在环境噪声、干扰说话者、瞬态声音乃至歌唱语音方面实现泛化。在本次演示中,参与者将能够通过麦克风和网页摄像头 setup 体验实时音视频目标语音增强,并通过耳机聆听干净的语音输出。

关键词

引用

@article{arxiv.2509.20741,
  title  = {Real-Time System for Audio-Visual Target Speech Enhancement},
  author = {T. Aleksandra Ma and Sile Yin and Li-Chia Yang and Shuo Zhang},
  journal= {arXiv preprint arXiv:2509.20741},
  year   = {2025}
}

备注

Accepted into WASPAA 2025 demo session