中文

基于卷积最近邻的注意力机制

计算机视觉与模式识别 2025-11-24 v2

摘要

从卷积神经网络向 Transformer 的转变已重塑了计算机视觉领域,但这两种架构通常被视为根本不同。我们认为,尽管卷积和自注意力在表面上存在差异,却可统一于单一的 k-最近邻聚合框架中。关键洞察在于,两种操作均为邻居选择与聚合的特例:卷积通过空间邻近性选择邻居,而注意力通过特征相似性选择邻居,揭示它们存在于连续谱上。我们引入卷积最近邻(ConvNN),一种统一框架,正式化了这一联系。 Crucially,ConvNN 可作为卷积层和注意力层的即插即用替代方案,使我们能够系统性地探索这两种极端之间的中间谱。我们在 CIFAR-10 和 CIFAR-100 分类任务上验证了该框架的连贯性,采用两种互补架构:(1)VGG 中的混合分支通过结合空间邻近性选择和特征相似性选择,在两个 CIFAR 数据集上提升准确率;(2)ConvNN 在 ViT 中的应用在两个数据集上超越标准注意力及其他注意力变体。对 k 值和架构变体的广泛消融实验表明,沿着这一谱系进行插值可通过平衡局部和全局感受野提供正则化优势。我们的工作提供了一个统一框架,消解卷积与注意力表面区别,旨为设计更原则化和可解释的视觉架构。

关键词

引用

@article{arxiv.2511.14137,
  title  = {Attention Via Convolutional Nearest Neighbors},
  author = {Mingi Kang and Jeová Farias Sales Rocha Neto},
  journal= {arXiv preprint arXiv:2511.14137},
  year   = {2025}
}