中文

即插即用的共现人脸注意力机制用于鲁棒视听说话人提取

音频与语音处理 2025-05-28 v1 人工智能 声音

摘要

视听说话人提取旨在根据视觉线索(通常使用目标说话人的面部录像)从混合语音信号中分离出目标说话人的语音。然而,在真实场景中,屏幕上经常出现其他共现人脸,提供了场景中宝贵的说话人活动线索。在本工作中,我们引入了一个即插即用的说话人间注意力模块来处理这些数量可变的共现人脸,从而在复杂的多人环境中实现更准确的说话人提取。我们将该模块集成到两个主流模型中:AV-DPRNN和最先进的AV-TFGridNet。在多样化数据集上的大量实验,包括高度重叠的VoxCeleb2和稀疏重叠的MISP,表明我们的方法持续优于基线。此外,在LRS2和LRS3上的跨数据集评估证实了我们方法的鲁棒性和泛化能力。

关键词

引用

@article{arxiv.2505.20635,
  title  = {Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction},
  author = {Zexu Pan and Shengkui Zhao and Tingting Wang and Kun Zhou and Yukun Ma and Chong Zhang and Bin Ma},
  journal= {arXiv preprint arXiv:2505.20635},
  year   = {2025}
}

备注

Interspeech 2025