中文

基于跨模态判别网络的音视频说话人识别

音频与语音处理 2020-08-11 v1

摘要

音视频说话人识别是近期 2019 年 NIST 说话人识别评测 (SRE) 中的任务之一。神经科学与计算机科学的研究均指出视觉与听觉神经信号在认知过程中相互作用。这促使我们研究一种跨模态网络,即声脸判别网络 (VFNet),它建立了人声与人脸之间的通用关系。实验表明,VFNet 提供了额外的说话人判别信息。借助 VFNet,我们在 2019 年 NIST SRE 的评测集上相对于分数级融合音视频基线取得了 16.54% 的等错误率相对降低。

关键词

引用

@article{arxiv.2008.03894,
  title  = {Audio-visual Speaker Recognition with a Cross-modal Discriminative Network},
  author = {Ruijie Tao and Rohan Kumar Das and Haizhou Li},
  journal= {arXiv preprint arXiv:2008.03894},
  year   = {2020}
}