中文

A$^{3}$lign-DFER:利用 CLIP 开创动态面部表情识别的全面动态情感对齐

计算机视觉与模式识别 2024-03-08 v1

摘要

正如在其他基于 CLIP 的分类任务中观察到的那样,CLIP 在动态面部表情识别(DFER)任务中的表现并未产生卓越结果。虽然 CLIP 的主要目标是在特征空间中实现图像与文本的对齐,但 DFER 由于文本的抽象性和视频的动态性而面临挑战,使得标签表示受限且完美对齐难以实现。为解决这一问题,我们设计了 A3^{3}lign-DFER,引入了一种新的 DFER 标注范式以全面实现对齐,从而增强 CLIP 对 DFER 任务的适用性。具体而言,我们的 A3^{3}lign-DFER 方法设计了多个协同工作的模块,以获取最适合分类的扩展维度嵌入,并在三个关键方面实现对齐:情感、动态和双向。我们将输入标签文本替换为可学习的多维对齐令牌(MAT),从而能够在情感和动态维度上将文本与面部表情视频样本对齐。在 CLIP 特征提取之后,我们引入了联合动态对齐同步器(JAS),进一步促进时间维度上的同步和对齐。此外,我们实施了双向对齐训练范式(BAP),以确保两种模态参数的渐进且稳定的训练。我们富有洞察力且简洁的 A3^{3}lign-DFER 方法在多个 DFER 数据集(包括 DFEW、FERV39k 和 MAFW)上取得了最先进(SOTA)的结果。广泛的消融实验和可视化研究证明了 A3^{3}lign-DFER 的有效性。代码将在未来公开。

关键词

引用

@article{arxiv.2403.04294,
  title  = {A$^{3}$lign-DFER: Pioneering Comprehensive Dynamic Affective Alignment for Dynamic Facial Expression Recognition with CLIP},
  author = {Zeng Tao and Yan Wang and Junxiong Lin and Haoran Wang and Xinji Mai and Jiawen Yu and Xuan Tong and Ziheng Zhou and Shaoqi Yan and Qing Zhao and Liyuan Han and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2403.04294},
  year   = {2024}
}