中文

利用自动标注数据集学习视觉语音活动检测

计算机视觉与模式识别 2020-10-19 v2

摘要

视觉语音活动检测(V-VAD)利用视觉特征预测一个人是否在说话。每当音频 VAD(A-VAD)因声学信号难以分析或根本缺失而低效时,V-VAD 都很有用。我们提出了两种用于 V-VAD 的深度架构,一种基于面部标志点,一种基于光流。此外,现有用于学习和测试 V-VAD 的数据集缺乏内容多样性。我们引入一种基于将 A-VAD 与人脸检测及跟踪相结合、在真实场景中自动创建并标注极大数据集——WildVVAD——的新方法。详尽的实证评估显示了用该数据集训练所提深度 V-VAD 模型的优势。

关键词

引用

@article{arxiv.2009.11204,
  title  = {Learning Visual Voice Activity Detection with an Automatically Annotated Dataset},
  author = {Sylvain Guy and Stéphane Lathuilière and Pablo Mesejo and Radu Horaud},
  journal= {arXiv preprint arXiv:2009.11204},
  year   = {2020}
}

备注

International Conference on Pattern Recognition, Milan, Italy, January 2021