中文

基于时间定向参考帧的 3D-CNN 长视频序列面部微表情与宏表情 spotting

计算机视觉与模式识别 2022-05-30 v4

摘要

面部表情 spotting 是微表情与宏表情分析的预备步骤。在视频序列中可靠地 spotting 此类表情的任务目前尚未解决。当前最佳系统依赖于光流方法提取区域运动特征,再将该运动分类为特定类别的面部动作。光流易受漂移误差影响,这对具有长期依赖的运动(如高帧率宏表情)带来了严重问题。我们提出一种纯深度学习方案:不再追踪帧间差分运动,而是通过卷积模型将每一帧与两帧时间局部参考帧进行比较。参考帧根据计算得到的微表情与宏表情持续时间进行采样。作为 MEGC2021 使用留一受试者交叉验证方法的基线,我们表明该方案在高帧率(200 fps)SAMM 长视频数据集(SAMM-LV)上取得 0.105 的 F1 分数,并在低帧率(30 fps)(CAS(ME)2)数据集上具竞争力。在未见过的 MEGC2022 挑战数据集上,基线结果为 SAMM 挑战数据集 0.1176、CAS(ME)3 上 0.1739,以及两数据集总体性能 0.1531。

关键词

引用

@article{arxiv.2105.06340,
  title  = {3D-CNN for Facial Micro- and Macro-expression Spotting on Long Video Sequences using Temporal Oriented Reference Frame},
  author = {Chuin Hong Yap and Moi Hoon Yap and Adrian K. Davison and Connah Kendrick and Jingting Li and Sujing Wang and Ryan Cunningham},
  journal= {arXiv preprint arXiv:2105.06340},
  year   = {2022}
}