一种用于因果音视频语音分离的快速轻量模型
声音
2025-10-15 v2 音频与语音处理
摘要
音视频语音分离(AVSS)旨在利用听觉和视觉(唇部动作)线索从混合信号中提取目标语音信号。然而,大多数现有AVSS方法都具有复杂的体系结构且依赖未来语境,离线运行,因而不适用于实时应用。灵感来自RTFSNet的管道,我们提出了一种新型流式AVSS模型,命名为Swift-Net,它增强了实时应用所需的因果处理能力。Swift-Net采用轻量级视觉特征提取模块和高效的音视频融合模块。此外,Swift-Net采用分组SRUs整合不同特征空间中的历史信息,从而提高了历史信息的利用效率。我们进一步提出了一种因果转换模板,以促进非因果AVSS模型向因果对应量的转换。在三个标准基准数据集(LRS2、LRS3和VoxCeleb2)上的实验表明,在因果条件下,我们提出的Swift-Net表现出色,凸显了该方法在复杂环境中处理语音的潜力。
引用
@article{arxiv.2506.06689,
title = {A Fast and Lightweight Model for Causal Audio-Visual Speech Separation},
author = {Wendi Sang and Kai Li and Runxuan Yang and Jianqiang Huang and Xiaolin Hu},
journal= {arXiv preprint arXiv:2506.06689},
year = {2025}
}
备注
Accepted by ECAI 2025