Vision Transformer 中 Key 的流形表示
计算机视觉与模式识别
2024-06-10 v2 机器学习
摘要
Vision Transformer 通过堆叠多个注意力块来实现多头自注意力。查询、键和值通常在这些块内通过单一的共享线性变换交织生成。本文探索了将键从查询和值中解耦,并为键采用流形表示的概念。我们的实验表明,解耦并赋予键流形结构可以增强模型的性能。具体而言,在 ImageNet-1K 数据集上,ViT-B 的 top-1 准确率提高了 0.87%,而 Swin-T 的 top-1 准确率提高了 0.52%,其中流形键包含八个图表。我们的方法在 COCO 数据集的目标检测和实例分割任务中也产生了积极的结果。我们证实这些性能提升不仅仅是因为增加了更多参数和计算的简单性。未来的研究可以探索削减此类表示预算的策略,并基于我们的发现寻求进一步的性能提升。
引用
@article{arxiv.2402.00534,
title = {A Manifold Representation of the Key in Vision Transformers},
author = {Li Meng and Morten Goodwin and Anis Yazidi and Paal Engelstad},
journal= {arXiv preprint arXiv:2402.00534},
year = {2024}
}