中文

SEWA DB:一种用于真实场景下音视频情感与情绪研究的丰富数据库

人机交互 2019-11-20 v2 人工智能 计算机视觉与模式识别

摘要

随着数字设备日益成为我们生活中不可或缺的一部分,能够在真实场景下实现鲁棒性能的自然人机交互与音视频人类行为感知系统比以往任何时候都更为需要。准确标注的真实世界数据是设计此类系统的关键。然而,现有数据库通常考虑受控环境、低人口统计学差异性以及单一任务。在本文中,我们介绍了 SEWA 数据库,其包含来自六种文化的 398 人、超过 2000 分钟的音视频数据,其中女性占 50%,年龄均匀分布于 18 至 65 岁。受试者在两种不同情境下被记录:观看广告时与在视频聊天中讨论广告时。该数据库包含对记录的丰富标注,涉及面部 landmarks、面部动作单元(FAU)、各种发声、镜像行为,以及连续取值的效价、唤醒度、喜好度、认同度,以及(不)喜好的原型样例。该数据库旨在成为情感计算与自动人类感知研究者的极有价值资源,并有望推动人类行为分析(包括文化研究)方面的研究。连同该数据库,我们提供了用于自动 FAU 检测以及自动效价、唤醒度和(不)喜好强度估计的广泛基线实验。

关键词

引用

@article{arxiv.1901.02839,
  title  = {SEWA DB: A Rich Database for Audio-Visual Emotion and Sentiment Research in the Wild},
  author = {Jean Kossaifi and Robert Walecki and Yannis Panagakis and Jie Shen and Maximilian Schmitt and Fabien Ringeval and Jing Han and Vedhas Pandit and Antoine Toisoul and Bjorn Schuller and Kam Star and Elnar Hajiyev and Maja Pantic},
  journal= {arXiv preprint arXiv:1901.02839},
  year   = {2019}
}