中文

利用视听线索的目标活跃说话人检测

音频与语音处理 2023-06-13 v3 声音

摘要

在活跃说话人检测(ASD)中,我们期望基于视听线索检测屏幕上人物是否在说话。以往研究主要关注建模视听同步线索,其依赖于说话人唇部区域的视频质量。在实际应用中,我们也可能拥有屏幕上说话人的参考语音。为同时利用面部线索与参考语音,我们提出目标说话人 TalkNet(TS-TalkNet),其利用预注册的说话人嵌入来补充视听同步线索,以检测目标说话人是否在说话。我们的框架在两个数据集上优于流行模型 TalkNet,在 AVA-ActiveSpeaker 验证集上 mAP 绝对提升 1.6%,在 ASW 测试集上 AP、AUC 和 EER 分别绝对提升 0.8%、0.4% 和 0.8%。代码见 https://github.com/Jiang-Yidi/TS-TalkNet/。

关键词

引用

@article{arxiv.2305.12831,
  title  = {Target Active Speaker Detection with Audio-visual Cues},
  author = {Yidi Jiang and Ruijie Tao and Zexu Pan and Haizhou Li},
  journal= {arXiv preprint arXiv:2305.12831},
  year   = {2023}
}

备注

Accepted to INTERSPEECH2023