通过三元组压缩与激励模块实现三维注意力
计算机视觉与模式识别
2025-05-12 v1 人工智能
机器学习
摘要
ConvNeXt 及其变体的出现,再次证实了基于 CNN 的模型在视觉任务中概念和结构上的适用性,使其重新成为图像分类,特别是面部表情识别(FER)领域的关键角色。本文提出了一组新的模型,这些模型基于上述进展,通过引入一组新的注意力机制,以四种不同的变体将三元组注意力(Triplet attention)与压缩-激励(Squeeze-and-Excitation,TripSE)相结合。我们通过将这些变体应用于 ResNet18、DenseNet 和 ConvNeXt 架构来验证其有效性和影响,以证明其通用性。我们的研究表明,在这些 CNN 模型中引入 TripSE 模块能提升其性能,尤其对 ConvNeXt 架构效果显著,表明了其实用性。我们在四个数据集上评估了所提出的机制及相关模型,即 CIFAR100、ImageNet、FER2013 和 AffectNet 数据集,其中带有 TripSE 的 ConvNext 在流行的 FER2013 数据集上取得了最先进的结果,准确率达到 \textbf{78.27\%},为该数据集创下了新纪录。
引用
@article{arxiv.2505.05943,
title = {Achieving 3D Attention via Triplet Squeeze and Excitation Block},
author = {Maan Alhazmi and Abdulrahman Altahhan},
journal= {arXiv preprint arXiv:2505.05943},
year = {2025}
}