噪声环境下基于轻量级迭代模型的视听语音分离
音频与语音处理
2023-06-02 v1 机器学习
声音
摘要
我们提出了视听轻量级迭代模型(AVLIT),这是一种有效且轻量级的神经网络,利用渐进学习(PL)在噪声环境中进行视听语音分离。为此,我们采用了异步全循环卷积神经网络(A-FRCNN),该网络在纯音频语音分离中已展现出成功结果。我们的架构由一个音频分支和一个视频分支组成,各模态的迭代 A-FRCNN 块共享权重。我们在受控环境中使用 NTCD-TIMIT 数据集、在真实场景中使用结合 LRS3 与 WHAM! 的合成数据集对模型进行了评估。实验表明,相对于多种纯音频与视听基线,我们的模型在两种设置下均具有优越性。此外,模型 footprint 的减小使其适用于低资源应用。
引用
@article{arxiv.2306.00160,
title = {Audio-Visual Speech Separation in Noisy Environments with a Lightweight Iterative Model},
author = {Héctor Martel and Julius Richter and Kai Li and Xiaolin Hu and Timo Gerkmann},
journal= {arXiv preprint arXiv:2306.00160},
year = {2023}
}
备注
Accepted by Interspeech 2023