利用视听线索的目标活跃说话人检测
音频与语音处理
2023-06-13 v3 声音
摘要
在活跃说话人检测(ASD)中,我们期望基于视听线索检测屏幕上人物是否在说话。以往研究主要关注建模视听同步线索,其依赖于说话人唇部区域的视频质量。在实际应用中,我们也可能拥有屏幕上说话人的参考语音。为同时利用面部线索与参考语音,我们提出目标说话人 TalkNet(TS-TalkNet),其利用预注册的说话人嵌入来补充视听同步线索,以检测目标说话人是否在说话。我们的框架在两个数据集上优于流行模型 TalkNet,在 AVA-ActiveSpeaker 验证集上 mAP 绝对提升 1.6%,在 ASW 测试集上 AP、AUC 和 EER 分别绝对提升 0.8%、0.4% 和 0.8%。代码见 https://github.com/Jiang-Yidi/TS-TalkNet/。
引用
@article{arxiv.2305.12831,
title = {Target Active Speaker Detection with Audio-visual Cues},
author = {Yidi Jiang and Ruijie Tao and Zexu Pan and Haizhou Li},
journal= {arXiv preprint arXiv:2305.12831},
year = {2023}
}
备注
Accepted to INTERSPEECH2023