AUFormer: Vision Transformer 作为参数高效的面部动作单元检测器
计算机视觉与模式识别
2024-07-10 v2 人工智能
摘要
面部动作单元 (AU) 是情感计算领域的一个重要概念,AU 检测一直是一个热门研究课题。现有方法由于在稀缺的 AU 标注数据集上使用大量可学习参数或严重依赖大量额外相关数据,存在过拟合问题。参数高效迁移学习 (PETL) 提供了一种有前景的范式来解决这些挑战,而其现有方法缺乏针对 AU 特性的设计。因此,我们创新性地将 PETL 范式应用于 AU 检测,引入了 AUFormer 并提出了一种新颖的混合知识专家 协作机制。针对特定 AU 且具有极少可学习参数的单个 MoKE 首先整合个性化的多尺度和相关性知识。然后,该 MoKE 与专家组中的其他 MoKE 协作以获取聚合信息,并将其注入冻结的 Vision Transformer (ViT) 以实现参数高效的 AU 检测。此外,我们设计了一种 Margin-truncated Difficulty-aware Weighted Asymmetric Loss (MDWA-Loss),它可以鼓励模型更多地关注已激活的 AU,区分未激活 AU 的难度,并丢弃潜在被错误标记的样本。来自各个视角的大量实验,包括域内、跨域、数据效率和微表情域,证明了 AUFormer 在不依赖额外相关数据的情况下具有 SOTA 性能和强大的泛化能力。AUFormer 的代码可在 https://github.com/yuankaishen2001/AUFormer 获取。
引用
@article{arxiv.2403.04697,
title = {AUFormer: Vision Transformers are Parameter-Efficient Facial Action Unit Detectors},
author = {Kaishen Yuan and Zitong Yu and Xin Liu and Weicheng Xie and Huanjing Yue and Jingyu Yang},
journal= {arXiv preprint arXiv:2403.04697},
year = {2024}
}
备注
Accepted by ECCV 2024