中文

FERV39k:用于视频中面部表情识别的大规模多场景数据集

计算机视觉与模式识别 2022-03-22 v2

摘要

当前面部表情识别(FER)的基准主要聚焦于静态图像,而用于视频中 FER 的数据集有限。现有方法在真实世界面向应用的场景中的性能是否仍令人满意仍不明确。例如,脱口秀中高强度的“高兴”表情比官方活动中低强度的同一表情更具区分性。为填补此空白,我们构建了一个大规模多场景数据集,称为 FERV39k。我们从三方面分析了构建此类新颖数据集的重要要素:(1)多场景层次与表情类别,(2)候选视频片段的生成,(3)可信的人工标注流程。基于这些准则,我们选取细分为 22 个场景的 4 种情境,依据精心设计的工作流对从 4k 视频中自动获取的 86k 样本进行标注,最终构建了标有 7 种经典表情的 38,935 个视频片段。我们还提供了四类基线框架上的实验基准,并进一步分析了它们在不同场景下的性能以及未来研究的一些挑战。此外,我们通过消融研究系统地考察了动态面部表情识别(DFER)的关键组件。基线框架与我们的项目将公开可用。

关键词

引用

@article{arxiv.2203.09463,
  title  = {FERV39k: A Large-Scale Multi-Scene Dataset for Facial Expression Recognition in Videos},
  author = {Yan Wang and Yixuan Sun and Yiwen Huang and Zhongying Liu and Shuyong Gao and Wei Zhang and Weifeng Ge and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2203.09463},
  year   = {2022}
}

备注

Accepted for CVPR2022