中文

视听时刻数据集:大规模标注的视听动作数据集

机器学习 2023-08-21 v1 计算机视觉与模式识别 多媒体 声音 音频与语音处理

摘要

我们提出视听时刻数据集(AVMIT),一个大规模的视听动作事件数据集。在一项广泛的标注任务中,11 名参与者标注了来自 Moments in Time 数据集(MIT)的 3 秒视听视频子集。在每次试验中,参与者评估所标注的视听动作事件是否存在,以及其是否为视频中最显著的特征。该数据集包含 57,177 个视听视频的标注,每个视频由 11 名受训参与者中的 3 人独立评估。从这一初始收集中,我们创建了一个精选测试集,包含 16 个不同的动作类别,每类 60 个视频(共 960 个视频)。我们还提供了两组预计算的视听特征嵌入,使用 VGGish/YamNet 处理音频数据、VGG16/EfficientNetB0 处理视觉数据,从而降低了视听 DNN 研究的入门门槛。我们探索了 AVMIT 标注与特征嵌入在提升视听事件识别性能上的优势。我们在 AVMIT 过滤的视听事件或来自 MIT 的模态无关事件上训练了 6 个循环神经网络(RNN),并在我们的视听测试集上测试。在所有 RNN 中,仅使用视听事件训练使 top 1 准确率提升了 2.71–5.94%,甚至胜过了训练数据三倍的增长。我们预期这一新标注的 AVMIT 数据集将作为涉及计算模型与人类参与者的研究与比较实验的宝贵资源,特别是在视听对应至关重要性的研究问题中。

关键词

引用

@article{arxiv.2308.09685,
  title  = {Audiovisual Moments in Time: A Large-Scale Annotated Dataset of Audiovisual Actions},
  author = {Michael Joannou and Pia Rotshtein and Uta Noppeney},
  journal= {arXiv preprint arXiv:2308.09685},
  year   = {2023}
}