中文

噪声环境下基于轻量级迭代模型的视听语音分离

音频与语音处理 2023-06-02 v1 机器学习 声音

摘要

我们提出了视听轻量级迭代模型(AVLIT),这是一种有效且轻量级的神经网络,利用渐进学习(PL)在噪声环境中进行视听语音分离。为此,我们采用了异步全循环卷积神经网络(A-FRCNN),该网络在纯音频语音分离中已展现出成功结果。我们的架构由一个音频分支和一个视频分支组成,各模态的迭代 A-FRCNN 块共享权重。我们在受控环境中使用 NTCD-TIMIT 数据集、在真实场景中使用结合 LRS3 与 WHAM! 的合成数据集对模型进行了评估。实验表明,相对于多种纯音频与视听基线,我们的模型在两种设置下均具有优越性。此外,模型 footprint 的减小使其适用于低资源应用。

关键词

引用

@article{arxiv.2306.00160,
  title  = {Audio-Visual Speech Separation in Noisy Environments with a Lightweight Iterative Model},
  author = {Héctor Martel and Julius Richter and Kai Li and Xiaolin Hu and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2306.00160},
  year   = {2023}
}

备注

Accepted by Interspeech 2023