中文

MoMuSE:针对视觉线索受损的实时场景下动量多模态目标说话人提取

声音 2025-04-01 v2 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

音视频目标说话人提取(AV-TSE)旨在从音频混合信号中提取特定目标说话人的语音,利用同步的视觉线索。在现实场景中,由于各种原因,视觉线索并始终可用,这削弱了AV-TSE的稳定性。尽管面临这一挑战,人类仍能在目标说话人不可见时维持注意力动力。本文引入动力多模态目标说话人提取(MoMuSE),通过在记忆中保留说话人身份动力,使模型能够持续跟踪目标说话人。为实现实时推理,MoMuSE利用视觉线索和动态更新的说话人动力,提取当前语音窗口。实验结果表明,MoMuSE 在视觉线索严重受损的场景中表现出显著改进。

关键词

引用

@article{arxiv.2412.08247,
  title  = {MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues},
  author = {Junjie Li and Ke Zhang and Shuai Wang and Kong Aik Lee and Man-Wai Mak and Haizhou Li},
  journal= {arXiv preprint arXiv:2412.08247},
  year   = {2025}
}