中文

用于面部表情识别的视频联合嵌入预测架构

计算机视觉与模式识别 2026-01-15 v1 人机交互

摘要

本文介绍了视频联合嵌入预测架构(V-JEPA)在面部表情识别(FER)中的新颖应用。不同于依赖像素级重建的传统视频理解预训练方法,V-JEPA 通过从未掩码区域的嵌入预测掩码区域的嵌入来进行学习。这使得训练后的编码器不会捕获给定视频中的无关信息,例如背景中像素区域的颜色。我们使用预训练的 V-JEPA 视频编码器,在 RAVDESS 和 CREMA-D 数据集上训练浅层分类器,在 RAVDESS 上达到了最先进的性能,并在 CREMA-D 上超越了所有其他基于视觉的方法(+1.48 WAR)。此外,跨数据集评估揭示了强大的泛化能力,展示了纯粹基于嵌入的预训练方法在推进 FER 方面的潜力。我们在 https://github.com/lennarteingunia/vjepa-for-fer 发布了代码。

关键词

引用

@article{arxiv.2601.09524,
  title  = {Video Joint-Embedding Predictive Architectures for Facial Expression Recognition},
  author = {Lennart Eing and Cristina Luna-Jiménez and Silvan Mertes and Elisabeth André},
  journal= {arXiv preprint arXiv:2601.09524},
  year   = {2026}
}

备注

To appear in 2025 Proceedings of the 13th International Conference on Affective Computing and Intelligent Interaction (ACII), submitted to IEEE. \c{opyright} 2025 IEEE