HAViT:历史注意力视觉转换器
计算机视觉与模式识别
2026-03-20 v1
摘要
视觉转换器在计算机视觉中表现出色,但其注意力机制在各层之间独立工作,限制了信息的传递和特征学习。我们提出了一种有效的跨层注意力传播方法,通过保留和整合各编码器层之间的历史注意力矩阵,为视觉转换器的层间信息流提供原则性的细化。这种方法使注意力模式在转换器层级结构中逐步细化,增强了特征获取和优化动力学。该方法只需极少的架构更改,仅添加注意力矩阵存储和混合操作。在 CIFAR-100 和 TinyImageNet 上的全面实验表明,HAViT 在准确率上实现了持续的改进,ViT 在 CIFAR-100 上的性能从 75.74% 提升至 77.07%(提升 1.33%),在 TinyImageNet 上的性能从 57.82% 提升至 59.07%(提升 1.25%)。跨架构验证显示,CaiT 等类似变体也能获得类似的提升。系统分析识别出历史注意力混合参数(alpha = 0.45)在所有配置下均为最佳,提供了当前和历史注意力信息之间理想的平衡。随机初始化始终优于零初始化,表明多样化的初始注意力模式可加速收敛并提高最终性能。我们的代码已公开于 https://github.com/banik-s/HAViT。
引用
@article{arxiv.2603.18585,
title = {HAViT: Historical Attention Vision Transformer},
author = {Swarnendu Banik and Manish Das and Shiv Ram Dubey and Satish Kumar Singh},
journal= {arXiv preprint arXiv:2603.18585},
year = {2026}
}