中文

用于统一、灵活且鲁棒的视听说话人日记的多输入多输出目标说话人语音活动检测

音频与语音处理 2025-08-01 v3

摘要

视听学习在许多经典语音任务(例如语音分离、自动语音识别、唤醒词检测)中已展现出令人鼓舞的结果。我们相信引入视觉模态也将有益于说话人日记 (speaker diarization)。迄今为止,目标说话人语音活动检测 (TS-VAD) 在高精度说话人日记中发挥着重要作用。然而,之前的 TS-VAD 模型仅采用音频特征并利用说话人的声学足迹来区分其个人语音活动,这在多说话人场景中容易受到重叠语音的影响。虽然视觉信息天然地容忍重叠语音,但它 suffers 从空间遮挡、低分辨率等问题。潜在的模态缺失问题阻碍了 TS-VAD 向视听方法的演进。本文提出了一种用于说话人日记的新型多输入多输出目标说话人语音活动检测 (MIMO-TSVAD) 框架。所提出的方法可以接受视听输入,并利用说话人的声学足迹或唇部轨迹,在统一的序列到序列框架中灵活地执行基于音频、基于视频以及基于视听的说话人日记。实验结果表明,MIMO-TSVAD 框架在 VoxConverse、DIHARD-III 和 MISP 2022 数据集上,在相应的评估指标下展现了最先进的性能,分别获得了 4.18%、10.10% 和 8.15% 的日记错误率 (DERs)。此外,它在严重的唇部缺失场景中也能表现鲁棒。

关键词

引用

@article{arxiv.2401.08052,
  title  = {Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization},
  author = {Ming Cheng and Ming Li},
  journal= {arXiv preprint arXiv:2401.08052},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Audio, Speech, and Language Processing