中文

MTCAE-DFER:用于动态面部表情识别的多任务级联自动编码器

计算机视觉与模式识别 2025-07-29 v2 机器学习 多媒体

摘要

本文扩展了基于自动编码器的多任务学习 (MTL) 框架中级联网络分支,用于动态面部表情识别,即 Multi-Task Cascaded Autoencoder for Dynamic Facial Expression Recognition (MTCAE-DFER)。MTCAE-DFER 构建了一个基于 Vision Transformer (ViT) 架构的模块化级联解码器模块,采用 Transformer 的解码器概念来重构多头注意力模块。解码器来自前一个任务的输出作为查询 (Q),代表局部动态特征,而 VideoMAE 共享编码器的输出同时作为键 (K) 和值 (V),代表全局动态特征。这种设置促进了跨相关任务的全局和局部动态特征之间的相互作用。此外,该提案旨在缓解复杂大模型的过拟合问题。我们利用基于自动编码器的多任务级联学习方法,探索动态面部检测和动态面部关键点对动态面部表情识别的影响,从而增强模型的泛化能力。经过在 various public 数据集上进行大量消融实验和与最先进 (SOTA) 方法的比较后,MTCAE-DFER 模型的鲁棒性以及全局-局部动态特征在相关任务中相互作用的有效性已被证明。

关键词

引用

@article{arxiv.2412.18988,
  title  = {MTCAE-DFER: Multi-Task Cascaded Autoencoder for Dynamic Facial Expression Recognition},
  author = {Peihao Xiang and Kaida Wu and Ou Bai},
  journal= {arXiv preprint arXiv:2412.18988},
  year   = {2025}
}

备注

Camera-ready Version, Accepted by IJCB 2025