静态即动态:深入理解动态面部表情
计算机视觉与模式识别
2025-10-31 v3
摘要
动态面部表情识别 (DFER) 通过分析表情的时间演化来推断情绪,与静态面部表情识别 (SFER) 不同,后者仅依赖单一快照。这种时间分析提供了更丰富的信息,具有更大的识别潜力。然而,当前的 DFER 方法因训练样本相较于 SFER 较少,往往表现不佳。鉴于静态和动态表情之间存在内在关联性,我们假设利用丰富的 SFER 数据可提升 DFER。为此,我们提出了静态即动态 (S4D) 框架,该框架将 SFER 数据作为补充资源集成到 DFER 中。具体而言,S4D 使用基于共享视觉变换器 (ViT) 编码器-解码器架构的面部图像和视频进行双模态自监督预训练,以获得更好的时空表征。随后在静态和动态表情数据集上对预训练编码器进行微调,采用多任务学习设置以促进情感信息的相互作用。不幸的是,我们研究中的基础多任务学习导致负迁移。为解决此问题,我们提出了创新的适配器专家混合 (MoAE) 模块,以促进任务特定的知识获取,同时有效地从静态和动态表情数据中提取共享知识。大量实验表明,S4D 能更深入地理解 DFER,在 FERV39K、MAFW 和 DFEW 数据集上实现了新的状态-of-the-art 性能,分别达到 53.65%、58.44% 和 76.68% 的加权平均召回率 (WAR)。此外,还提出了 SFER 和 DFER 任务之间的系统性相关性分析,进一步阐明了利用 SFER 的潜在优势。
引用
@article{arxiv.2409.06154,
title = {Static for Dynamic: Towards a Deeper Understanding of Dynamic Facial Expressions Using Static Expression Data},
author = {Yin Chen and Jia Li and Yu Zhang and Zhenzhen Hu and Shiguang Shan and Meng Wang and Richang Hong},
journal= {arXiv preprint arXiv:2409.06154},
year = {2025}
}
备注
The code and model are publicly available here https://github.com/MSA-LMC/S4D