中文

MeMo: 用于视觉受损条件下实时视听说话人提取的注意力动量

声音 2025-07-22 v1 多媒体

摘要

视听目标说话人提取(AV-TSE)旨在通过利用视觉线索作为引导,从多说话人环境中分离出目标说话人的声音。然而,AV-TSE系统的性能严重依赖于这些视觉线索的质量。在视觉线索缺失或严重退化的极端场景下,系统可能无法准确提取目标说话人。相比之下,即使在没有明确辅助信息的情况下,人类也能保持对目标说话人的注意力。受这种人类认知能力的启发,我们提出了一个名为MeMo的新颖框架,该框架包含两个自适应记忆库,用于存储与注意力相关的信息。MeMo专为实时场景设计:一旦建立了初始注意力,即使视觉线索变得不可用,系统也能随时间维持注意力动量。我们进行了全面的实验来验证MeMo的有效性。实验结果表明,我们提出的框架相对于相应的基线,实现了至少2 dB的SI-SNR改进。

关键词

引用

@article{arxiv.2507.15294,
  title  = {MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions},
  author = {Junjie Li and Wenxuan Wu and Shuai Wang and Zexu Pan and Kong Aik Lee and Helen Meng and Haizhou Li},
  journal= {arXiv preprint arXiv:2507.15294},
  year   = {2025}
}