中文

NiNformer: 一种带有令牌混合生成门控函数的网络内网络Transformer

计算机视觉与模式识别 2025-05-05 v6 机器学习

摘要

注意力机制是Transformer架构的主要组成部分;它已在涵盖多个领域和任务的深度学习方面取得了显著进展。在计算机视觉中,注意力机制首先被引入Vision Transformer (ViT),随后其应用扩展到视觉领域的许多任务,如分类、分割、目标检测和图像生成。尽管注意力机制具有很强的表达能力和性能,但它存在计算成本高且需要大量数据集才能有效优化的缺点。为了解决这些不足,文献中提出了许多设计来减轻计算负担并缓解数据规模需求。视觉领域中此类尝试的例子包括MLP-Mixer、Conv-Mixer、Perciver-IO等,它们各有优缺点。本文引入了一种新的计算块作为标准ViT块的替代方案。新提出的块通过用网络内网络结构替换普通注意力层来降低计算需求,从而通过令牌混合过程生成的逐元素门控函数的动态学习来增强MLP-Mixer的静态方法。大量实验表明,所提出的设计在视觉领域图像分类任务的多个数据集上提供了比基线架构更好的性能。

关键词

引用

@article{arxiv.2403.02411,
  title  = {NiNformer: A Network in Network Transformer with Token Mixing Generated Gating Function},
  author = {Abdullah Nazhat Abdullah and Tarkan Aydin},
  journal= {arXiv preprint arXiv:2403.02411},
  year   = {2025}
}

备注

Neural Comput & Applic (2025)