中文

多模态目标说话人提取的模态丢弃训练策略

音频与语音处理 2025-07-10 v1

摘要

多模态目标说话人提取(MTSE)的主要目标是利用来自不同模态(如音频登记和对应目标说话人的视觉 feed)的互补信息,从语音混合信号中提取目标说话人。MTSE 系统预计即使在一种模态不可用时也能表现良好。实际情况下,系统常常因模态主导问题而受到影响,即一种模态的权重超过其他模态,从而限制了鲁棒性。本研究探讨了训练策略以及特定归一化层的架构选择,对yielding robust MTSE system in both non-causal and causal configurations产生的影响。特别地,我们提出了将模态丢弃训练(MDT)作为优于标准训练和多任务训练(MTT)策略的策略。在来自 LRS3 数据集的两说话人混合信号上的实验表明,MDT 策略有效且不受所选用归一化层的影响。相比之下,使用标准和 MTT 策略训练的模型易受模态主导问题影响,其性能取决于所选的归一化层。此外,我们展示了使用 MDT 策略训练的系统对使用提取语音作为登记信号具有鲁棒性,这凸显了其在目标说话人未登记的场景中的潜在应用价值。

关键词

引用

@article{arxiv.2507.06566,
  title  = {Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction},
  author = {Srikanth Korse and Mohamed Elminshawi and Emanuel A. P. Habets and Srikanth Raj Chetupalli},
  journal= {arXiv preprint arXiv:2507.06566},
  year   = {2025}
}

备注

Published in ICASSPW 2024 (HSCMA)