中文

FaVoA:人脸-语音关联助力模糊说话人检测

机器学习 2021-09-07 v1 计算机视觉与模式识别 声音 音频与语音处理 图像与视频处理

摘要

人脸与语音之间的强关联可在人脸可见时辅助主动说话人检测系统,即便在说话人面部不清晰或同一场景中有多人的困难设定下也是如此。通过能够从一个人的语音中估计其正面面部表征,即使在该场景中所有人都未检测到嘴部运动的极具挑战的情况下,也更容易判断他/她是否是被分类为主动说话人的潜在候选。通过将一个人脸-语音关联神经网络整合进现有的最先进主动说话人检测模型,我们提出了 FaVoA(Face-Voice Association Ambiguous Speaker Detector,人脸-语音关联模糊说话人检测器),一种能够正确分类特别模糊场景的神经网络模型。FaVoA 不仅发现正向关联,还有助于排除不匹配的人脸-语音关联,即人脸与语音不匹配的情况。其对门控双模态单元(gated-bimodal-unit)架构的融合使用,提供了一种定量确定每种模态对分类贡献程度的方法。

关键词

引用

@article{arxiv.2109.00577,
  title  = {FaVoA: Face-Voice Association Favours Ambiguous Speaker Detection},
  author = {Hugo Carneiro and Cornelius Weber and Stefan Wermter},
  journal= {arXiv preprint arXiv:2109.00577},
  year   = {2021}
}