AVA-ActiveSpeaker:用于主动说话人检测的视听数据集
计算机视觉与模式识别
2019-05-28 v2 多媒体
声音
音频与语音处理
摘要
主动说话人检测是视频分析算法中的重要组件,应用于说话人日记化、会议视频重定向、语音增强以及人机交互等。该任务缺乏大型、精细标注的视听数据集,制约了算法在数据多样性、环境与准确性方面的评估,致使比较与改进困难。本文提出将公开发布的 AVA 主动说话人检测数据集(AVA-ActiveSpeaker)以促进算法开发并支持比较。该数据集包含视频中按时间标注的人脸轨迹,其中每个人脸实例被标注为说话与否以及语音是否可听。数据集约含 365 万人工标注帧或约 38.5 小时人脸轨迹及对应音频。我们还提出一种用于主动说话人检测的新视听方法,并分析其性能,展示了其优势及该数据集的贡献。
引用
@article{arxiv.1901.01342,
title = {AVA-ActiveSpeaker: An Audio-Visual Dataset for Active Speaker Detection},
author = {Joseph Roth and Sourish Chaudhuri and Ondrej Klejch and Radhika Marvin and Andrew Gallagher and Liat Kaver and Sharadh Ramaswamy and Arkadiusz Stopczynski and Cordelia Schmid and Zhonghua Xi and Caroline Pantofaru},
journal= {arXiv preprint arXiv:1901.01342},
year = {2019}
}