MAE-DFER:面向自监督动态面部表情识别的高效掩码自编码器
计算机视觉与模式识别
2023-08-09 v2 人工智能
人机交互
多媒体
摘要
动态面部表情识别(DFER)对于开发智能且具共情能力的机器至关重要。该领域以往的工作主要局限于监督学习范式,受到现有数据集中有限标注数据的严重制约。受近期掩码自编码器(如 VideoMAE)前所未有的成功启发,本文提出 MAE-DFER,一种新颖的自监督方法,利用在大量无标注数据上的大规模自监督预训练来大幅推动 DFER 的发展。由于 VideoMAE 中采用的原始 Vision Transformer(ViT)在微调时需要大量计算,MAE-DFER 开发了高效的局部-全局交互 Transformer(LGI-Former)作为编码器。此外,除了 VideoMAE 中独立的表观内容重建外,MAE-DFER 还引入了显式的时域面部运动建模,以促使 LGI-Former 挖掘静态表观与动态运动信息。在六个数据集上的大量实验表明,MAE-DFER 始终以显著优势超越最先进的监督方法(例如,在 DFEW 上 UAR 提升 +6.30%,在 MAFW 上 UAR 提升 +8.34%),验证了其可通过大规模自监督预训练学习到强大的动态面部表征。此外,其性能与 VideoMAE 相当甚至更优,同时大幅降低了计算成本(约 38% FLOPs)。我们相信 MAE-DFER 为 DFER 的进步开辟了新途径,并能启发该领域乃至其他相关任务的更多研究。代码与模型已公开于 https://github.com/sunlicai/MAE-DFER。
引用
@article{arxiv.2307.02227,
title = {MAE-DFER: Efficient Masked Autoencoder for Self-supervised Dynamic Facial Expression Recognition},
author = {Licai Sun and Zheng Lian and Bin Liu and Jianhua Tao},
journal= {arXiv preprint arXiv:2307.02227},
year = {2023}
}
备注
ACM MM 2023 (camera ready). Codes and models are publicly available at https://github.com/sunlicai/MAE-DFER