多头注意力中的重叠头提高视觉变形金字塔
计算机视觉与模式识别
2025-02-04 v2
摘要
视觉变形金字塔在最近几年取得了显著进展,在大多数视觉任务中实现了最先进的性能。其成功的一个关键因素是引入了多头自注意力(MHSA)模块,使每个头能够通过独立应用注意力机制来学习不同的表示。在本文中,我们经验性地证明,视觉变形金字塔可以通过在 MHSA 中的头之间重叠来进一步提升。我们引入了多重重叠头自注意力(MOHSA),其中头与其两个相邻头在查询、键和值上进行重叠,而对于第一个和最后一个头采用零填充,因为它们只有一个相邻头。提出了各种重叠比例方案,以充分探究我们方法的最佳性能。该方法在四个基准数据集上使用五个变形金字塔模型进行评估,显著提升了性能。发布后将公开提供源代码。
引用
@article{arxiv.2410.14874,
title = {Improving Vision Transformers by Overlapping Heads in Multi-Head Self-Attention},
author = {Tianxiao Zhang and Bo Luo and Guanghui Wang},
journal= {arXiv preprint arXiv:2410.14874},
year = {2025}
}