用于视觉语音活动检测的 VVAD-LRS3 数据集
计算机视觉与模式识别
2024-01-03 v1 机器人学
摘要
机器人正成为日常设备,增加了与人的交互。为使人机交互更自然,需要实现诸如视觉语音活动检测(VVAD)等认知特征,即在给定相机视觉输入时检测人是否在说话。神经网络是图像处理、时间序列预测、自然语言处理及其他领域任务的最先进方法。这些网络需要大量标注数据。目前针对 VVAD 任务的数据集不多。本工作中我们创建了一个大规模数据集,称为 VVAD-LRS3 数据集,由 LRS3 数据集自动标注派生而来。VVAD-LRS3 数据集包含超过 44K 样本,超过下一个竞争性数据集(WildVVAD)的三倍。我们在四类特征上评估了不同基线:面部与唇部图像,以及面部与唇部关键点特征。通过在面部图像上使用卷积神经网络长短期记忆(CNN LSTM),在测试集上达到了 92% 的准确率。一项人类研究表明,他们在测试集上达到了 87.93% 的准确率。
引用
@article{arxiv.2109.13789,
title = {The VVAD-LRS3 Dataset for Visual Voice Activity Detection},
author = {Adrian Lubitz and Matias Valdenegro-Toro and Frank Kirchner},
journal= {arXiv preprint arXiv:2109.13789},
year = {2024}
}