面向面部表情识别的局部多头通道自注意力
计算机视觉与模式识别
2021-11-19 v2 人工智能
摘要
自 2017 年 Transformer 架构提出以来,已有诸多尝试将自注意力范式引入计算机视觉领域。本文中,我们提出了一种新颖的自注意力模块,它可轻易集成到几乎所有卷积神经网络中,并专为计算机视觉设计,即 LHC:局部(多)头通道(自注意力)。LHC 基于两个主要思想:首先,我们认为在计算机视觉中,利用自注意力范式的最佳方式是通道维应用,而非被更多探索的空间注意力,并且卷积不会像 NLP 中循环网络那样被注意力模块取代;其次,局部方法比全局注意力更有潜力克服卷积的局限。借助 LHC-Net,我们在著名的 FER2013 数据集上取得了新的 SOTA,且与先前 SOTA 相比,其复杂度显著降低,对“宿主”架构在计算成本上的影响也更小。
引用
@article{arxiv.2111.07224,
title = {Local Multi-Head Channel Self-Attention for Facial Expression Recognition},
author = {Roberto Pecoraro and Valerio Basile and Viviana Bono and Sara Gallo},
journal= {arXiv preprint arXiv:2111.07224},
year = {2021}
}
备注
https://github.com/Bodhis4ttva/LHC_Net