中文

如何设计用于真实场景下音视觉主动说话人检测的三阶段架构

计算机视觉与模式识别 2021-09-08 v2 机器学习 声音 音频与语音处理

摘要

成功的主动说话人检测需要一个三阶段流水线:(i)对片段中所有说话人进行音视觉编码,(ii)在每一帧内对参考说话人与背景说话人之间进行说话人间关系建模,以及(iii)对参考说话人进行时间建模。该流水线的每个阶段对所构建架构的最终性能都起着重要作用。基于一系列受控实验,本工作提出了若干用于音视觉主动说话人检测的实用准则。相应地,我们提出了一种称为ASDNet的新架构,该架构在AVA-ActiveSpeaker数据集上以93.5%的mAP达到了新的最先进水平,并以4.7%的大幅度优势超越第二名。我们的代码和预训练模型已公开可用。

关键词

引用

@article{arxiv.2106.03932,
  title  = {How to Design a Three-Stage Architecture for Audio-Visual Active Speaker Detection in the Wild},
  author = {Okan Köpüklü and Maja Taseska and Gerhard Rigoll},
  journal= {arXiv preprint arXiv:2106.03932},
  year   = {2021}
}

备注

Accepted to ICCV 2021