中文

FFNet: 基于MetaMixer的高效卷积混合器设计

计算机视觉与模式识别 2025-03-11 v2 人工智能 机器学习

摘要

Transformer由自注意力机制和前馈网络组成,彻底改变了各种视觉任务中的网络设计格局。虽然自注意力作为性能的关键因素被广泛探索,但前馈网络却很少受到关注。前馈网络是一种多功能算子,可无缝集成到几乎所有AI模型中,以有效利用丰富的表示。最近的研究还表明,前馈网络的功能类似于键值记忆。因此,类似于自注意力中的查询-键-值机制,前馈网络可以被视为一个记忆网络,其中输入作为查询,两个投影权重分别作为键和值。基于这些观察,我们假设竞争性能的关键在于查询-键-值框架本身。为了验证这一点,我们提出将自注意力转换为一个更像前馈网络的、仅使用卷积的高效令牌混合器,同时保留查询-键-值框架,即前馈化。具体来说,前馈化使用大核卷积替换查询-键-值交互,并采用GELU激活函数代替softmax。由此产生的令牌混合器,即前馈化注意力,作为检测局部分布空间模式的键值记忆,并在查询-键-值框架的每个相应子操作中,在与ConvNeXt块相反的维度上运行。基于上述两个模块,我们提出了一系列快速前馈网络。尽管仅由简单的算子组成,但FFNet在每个领域都优于复杂且高度专业化的方法,并具有显著的效率提升。这些结果验证了我们的假设,促使我们提出MetaMixer,一种不指定查询-键-值框架内子操作的通用混合器架构。

关键词

引用

@article{arxiv.2406.02021,
  title  = {FFNet: MetaMixer-based Efficient Convolutional Mixer Design},
  author = {Seokju Yun and Dongheon Lee and Youngmin Ro},
  journal= {arXiv preprint arXiv:2406.02021},
  year   = {2025}
}

备注

Code: https://github.com/ysj9909/FFNet