TransFER:利用 Transformer 学习关系感知的面部表情表示
计算机视觉与模式识别
2021-08-26 v1
摘要
面部表情识别(FER)在计算机视觉中受到了越来越多的关注。我们提出了 TransFER 模型,该模型能够学习丰富的关系感知局部表示。它主要由三个组件组成:多头注意力丢弃(MAD)、ViT-FER 和多头自注意力丢弃(MSAD)。首先,局部块在区分各种表情中起着重要作用,然而,现有的少数工作难以定位具有判别性且多样的局部块。当某些块由于姿态变化或视角改变而不可见时,这可能会导致严重的问题。为了解决这个问题,提出了 MAD 以随机丢弃一个注意力图。因此,模型被推动自适应地探索多样的局部块。其次,为了在不同局部块之间建立丰富的关系,将 Vision Transformer(ViT)用于 FER,称为 ViT-FER。由于使用全局视野来增强每个局部块,获得了更好的表示以提升 FER 性能。第三,多头自注意力允许 ViT 同时关注不同位置处来自不同信息子空间的特征。然而,在没有显式指导的情况下,多个自注意力可能提取相似的关系。为了解决这一问题,提出了 MSAD 以随机丢弃一个自注意力模块。结果,模型被迫学习多样局部块之间的丰富关系。我们提出的 TransFER 模型在几个 FER 基准上优于 SOTA 方法,展示了其有效性和实用性。
引用
@article{arxiv.2108.11116,
title = {TransFER: Learning Relation-aware Facial Expression Representations with Transformers},
author = {Fanglei Xue and Qiangchang Wang and Guodong Guo},
journal= {arXiv preprint arXiv:2108.11116},
year = {2021}
}
备注
Camera-ready, ICCV 2021