面向有偏人脸识别的动作单元感知视觉Transformer
计算机视觉与模式识别
2022-11-15 v1
摘要
研究已证明不同的面部表情识别(FER)数据集中存在域偏差和标签偏差,使得难以通过加入其他数据集来提升特定数据集的性能。针对FER偏差问题,近期研究主要聚焦于利用先进的域适应算法解决跨域问题。本文解决另一个问题:如何借助跨域数据集提升FER性能。与粗糙且有偏的表情标签不同,心理学研究表明面部动作单元(AU)是细粒度且客观的。受此启发,我们利用不同FER数据集的AU信息来提升性能,并做出如下贡献。首先,我们通过实验表明多个FER数据集的朴素联合训练对各数据集的FER性能是有害的。我们进一步引入表情特异性均值图像和AU余弦距离来度量FER数据集偏差。这一新颖度量与联合训练实验性退化的结论一致。其次,我们提出一个简单但概念新颖的框架——AU感知视觉Transformer(AU-ViT)。它通过联合训练带有AU或伪AU标签的辅助数据集来提升各数据集的性能。我们还发现AU-ViT对真实世界遮挡具有鲁棒性。此外,我们首次证明精心初始化的ViT可达到与先进深度卷积网络相当的性能。我们的AU-ViT在三个流行数据集上取得了最先进的性能,即在RAF-DB上为91.10%、在AffectNet上为65.59%、在FERPlus上为90.15%。代码与模型将很快发布。
引用
@article{arxiv.2211.06609,
title = {AU-Aware Vision Transformers for Biased Facial Expression Recognition},
author = {Shuyi Mao and Xinpeng Li and Qingyang Wu and Xiaojiang Peng},
journal= {arXiv preprint arXiv:2211.06609},
year = {2022}
}