中文

有人在说话吗?探索用于音视觉主动说话人检测的长时时间特征

音频与语音处理 2021-07-27 v2 声音 图像与视频处理

摘要

主动说话人检测(ASD)旨在检测在一个或多个说话人的视觉场景中谁正在说话。成功的ASD依赖于对短时与长时音频和视觉信息以及音视觉交互的准确解释。与先前工作使用短时特征即时决策的系统不同,我们提出了一种名为TalkNet的新框架,该框架通过同时考虑短时与长时特征来做出决策。TalkNet由用于特征表示的音频与视觉时间编码器、用于模态间交互的音视觉交叉注意力机制,以及用于捕获长时说话证据的自注意力机制组成。实验表明,TalkNet在AVA-ActiveSpeaker数据集和Columbia ASD数据集上分别比最先进系统提升了3.5%和2.2%。代码已公开于:https://github.com/TaoRuijie/TalkNet_ASD。

关键词

引用

@article{arxiv.2107.06592,
  title  = {Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection},
  author = {Ruijie Tao and Zexu Pan and Rohan Kumar Das and Xinyuan Qian and Mike Zheng Shou and Haizhou Li},
  journal= {arXiv preprint arXiv:2107.06592},
  year   = {2021}
}

备注

ACM Multimedia 2021