利用自动标注数据集学习视觉语音活动检测
计算机视觉与模式识别
2020-10-19 v2
摘要
视觉语音活动检测(V-VAD)利用视觉特征预测一个人是否在说话。每当音频 VAD(A-VAD)因声学信号难以分析或根本缺失而低效时,V-VAD 都很有用。我们提出了两种用于 V-VAD 的深度架构,一种基于面部标志点,一种基于光流。此外,现有用于学习和测试 V-VAD 的数据集缺乏内容多样性。我们引入一种基于将 A-VAD 与人脸检测及跟踪相结合、在真实场景中自动创建并标注极大数据集——WildVVAD——的新方法。详尽的实证评估显示了用该数据集训练所提深度 V-VAD 模型的优势。
引用
@article{arxiv.2009.11204,
title = {Learning Visual Voice Activity Detection with an Automatically Annotated Dataset},
author = {Sylvain Guy and Stéphane Lathuilière and Pablo Mesejo and Radu Horaud},
journal= {arXiv preprint arXiv:2009.11204},
year = {2020}
}
备注
International Conference on Pattern Recognition, Milan, Italy, January 2021