RAVSS:在多说者场景下鲁棒的音视频语音分离(带缺失视觉线索)
声音
2024-07-31 v2 多媒体
音频与语音处理
摘要
虽然现有的音视频语音分离(AVSS)方法主要集中在用于两种说者分离的音视频融合策略,但在多说者分离场景中表现严重下降。通常,AVSS方法会利用引导视频依次从给定音频混合信号中隔离单个说者,导致分离语音的各个片段存在显著的缺失和噪声。在本研究中,我们提出了一个能够在单个过程中实现多个说者同时分离的框架。我们引入说者间相互作用,以建立说者之间的区别和关联。在VoxCeleb2和LRS3数据集上进行的实验表明,我们的方法在分别分离2、3、4和5位说者时实现了最先进的性能。此外,我们的模型可以利用具有完整音视频信息的说者来缓解其他视觉不足的说者,从而提高其对缺失视觉线索的鲁棒性。我们还进行了视觉信息完全缺失或视觉帧部分缺失的实验。结果表明,我们的方法在所有涉及2、3、4和5位说者的设置中均表现出优于其他方法,且性能下降最小。
引用
@article{arxiv.2407.19224,
title = {RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues},
author = {Tianrui Pan and Jie Liu and Bohan Wang and Jie Tang and Gangshan Wu},
journal= {arXiv preprint arXiv:2407.19224},
year = {2024}
}
备注
Accepted by MM 2024