SVFAP:自监督视频面部情感感知器
计算机视觉与模式识别
2024-10-02 v2 人机交互
多媒体
摘要
基于视频的面部情感分析因其在人机交互中的关键作用而最近引起了越来越多的关注。先前的研究主要集中在开发各种深度学习架构并以全监督方式对其进行训练。尽管这些监督方法已取得显著进展,但长期以来缺乏大规模高质量标注数据严重阻碍了其进一步改进。受计算机视觉领域自监督学习近期成功的启发,本文引入了一种名为自监督视频面部情感感知器 (SVFAP) 的自监督方法,以解决监督方法面临的困境。具体而言,SVFAP 利用掩码面部视频自编码,在大量未标注的面部视频上执行自监督预训练。考虑到面部视频中存在巨大的时空冗余,我们提出了一种新颖的时间金字塔和空间瓶颈 Transformer 作为 SVFAP 的编码器,这不仅大幅降低了计算成本,还实现了卓越的性能。为了验证我们方法的有效性,我们在涵盖三个下游任务的九个数据集上进行了实验,包括动态面部表情识别、维度情感识别和个性识别。综合结果表明,SVFAP 能够通过大规模自监督预训练学习到强大的情感相关表征,并且在所有数据集上均显著优于之前的最先进方法。代码地址:https://github.com/sunlicai/SVFAP。
引用
@article{arxiv.2401.00416,
title = {SVFAP: Self-supervised Video Facial Affect Perceiver},
author = {Licai Sun and Zheng Lian and Kexin Wang and Yu He and Mingyu Xu and Haiyang Sun and Bin Liu and Jianhua Tao},
journal= {arXiv preprint arXiv:2401.00416},
year = {2024}
}
备注
Published in: IEEE Transactions on Affective Computing (Early Access). The code and models are available at https://github.com/sunlicai/SVFAP