中文

利用多模态提取预训练增强真实场景的主动说话人检测

音频与语音处理 2024-04-02 v1 图像与视频处理

摘要

音视频主动说话人检测(AV-ASD)旨在识别含有一人或多人场景中哪个可见人脸正在说话。大多数现有 AV-ASD 方法优先捕捉语音与唇部的对应关系。然而,在应对真实场景 AV-ASD 的挑战方面仍存在明显差距。由于此类场景中存在低质量含噪视频,缺乏选择性倾听能力的 AV-ASD 系统无法有效从混合音频输入中滤除破坏性语音成分。在本文中,我们提出了一种名为 MuSED 的多模态说话人提取到检测框架,该框架通过音视频目标说话人提取进行预训练以学习去噪能力,随后使用 AV-ASD 任务进行微调。同时,为了更好地捕捉多模态信息并处理诸如模态缺失等真实场景问题,MuSED 直接在时域上建模,并集成了多模态加减增强策略。我们的实验表明,MuSED 大幅优于最先进的 AV-ASD 方法,在 AVA-ActiveSpeaker 数据集上达到 95.6% mAP,在 ASW 数据集上达到 98.3% AP,在 Columbia AV-ASD 数据集上达到 97.9% F1。我们将在适当时机公开发布代码。

关键词

引用

@article{arxiv.2404.00861,
  title  = {Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training},
  author = {Ruijie Tao and Xinyuan Qian and Rohan Kumar Das and Xiaoxue Gao and Jiadong Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2404.00861},
  year   = {2024}
}

备注

10 pages