中文

EEV:用于研究视频诱发表情的大规模数据集

计算机视觉与模式识别 2021-02-23 v2

摘要

视频能在观看者中诱发一系列情感反应。在观看者观看视频之前,从视频预测诱发情感的能力有助于内容创作与视频推荐。我们介绍了视频诱发表情(EEV)数据集,一个用于研究观看者对视频反应的大规模数据集。每个视频以 6 Hz 标注有 15 个连续的诱发表情标签,对应于对视频作出反应的观看者的面部表情。我们在数据收集框架中使用表情识别模型以实现可扩展性。总计有对 23,574 个视频(1,700 小时)的 3670 万条观看者面部反应标注。我们使用公开可用的视频语料库来获取多样化的视频内容集合。我们利用已有的多模态循环模型在 EEV 数据集上建立了基线性能。迁移学习实验表明,在 EEV 上预训练后,在 LIRIS-ACCEDE 视频数据集上的性能得到提升。我们希望 EEV 数据集的规模与多样性将鼓励在视频理解与情感计算方面的进一步探索。EEV 的一个子集发布于 https://github.com/google-research-datasets/eev。

关键词

引用

@article{arxiv.2001.05488,
  title  = {EEV: A Large-Scale Dataset for Studying Evoked Expressions from Video},
  author = {Jennifer J. Sun and Ting Liu and Alan S. Cowen and Florian Schroff and Hartwig Adam and Gautam Prasad},
  journal= {arXiv preprint arXiv:2001.05488},
  year   = {2021}
}

备注

Data subset at https://github.com/google-research-datasets/eev