中文

通过三元组压缩与激励模块实现三维注意力

计算机视觉与模式识别 2025-05-12 v1 人工智能 机器学习

摘要

ConvNeXt 及其变体的出现,再次证实了基于 CNN 的模型在视觉任务中概念和结构上的适用性,使其重新成为图像分类,特别是面部表情识别(FER)领域的关键角色。本文提出了一组新的模型,这些模型基于上述进展,通过引入一组新的注意力机制,以四种不同的变体将三元组注意力(Triplet attention)与压缩-激励(Squeeze-and-Excitation,TripSE)相结合。我们通过将这些变体应用于 ResNet18、DenseNet 和 ConvNeXt 架构来验证其有效性和影响,以证明其通用性。我们的研究表明,在这些 CNN 模型中引入 TripSE 模块能提升其性能,尤其对 ConvNeXt 架构效果显著,表明了其实用性。我们在四个数据集上评估了所提出的机制及相关模型,即 CIFAR100、ImageNet、FER2013 和 AffectNet 数据集,其中带有 TripSE 的 ConvNext 在流行的 FER2013 数据集上取得了最先进的结果,准确率达到 \textbf{78.27\%},为该数据集创下了新纪录。

关键词

引用

@article{arxiv.2505.05943,
  title  = {Achieving 3D Attention via Triplet Squeeze and Excitation Block},
  author = {Maan Alhazmi and Abdulrahman Altahhan},
  journal= {arXiv preprint arXiv:2505.05943},
  year   = {2025}
}