中文

微小模型约束下视觉Transformer中查询、键与值嵌入的重新思考

计算机视觉与模式识别 2023-05-01 v1

摘要

视觉 Transformer(ViT)是计算机视觉领域的主导模型。尽管大量研究主要关注处理归纳偏置与复杂度问题,寻找更优 Transformer 网络的问题依然存在。例如,传统的基于 Transformer 的模型通常在多头自注意力之前对每个查询(Q)、键(K)和值(V)嵌入使用一个投影层。对语义 Q、K 和 V 嵌入考虑不足可能导致性能下降。在本文中,我们提出三种用于 Q、K 和 V 嵌入的结构。第一种结构利用带 ReLU 的两层,这是一种用于 Q、K 和 V 的非线性嵌入。第二种涉及共享其中一个非线性层以在 Q、K 和 V 之间共享知识。第三种提出的结构通过代码参数共享所有非线性层。这些代码是可训练的,其数值决定了要在 Q、K 和 V 之间执行的嵌入过程。因此,我们在实验中展示了所提方法相较于若干 SOTA 方法的更优图像分类性能。所提方法在 ImageNet-1k 数据集上以少量参数(3.1M3.1M)取得了 71.4%71.4\% 的准确率,而原始 Transformer 模型 XCiT-N12 需达到 69.9%69.9\%。此外,该方法在 CIFAR-10、CIFAR-100、Stanford Cars 数据集和 STL-10 数据集的迁移学习上平均仅用 2.9M2.9M 参数取得了 93.3%93.3\% 的准确率,优于原始 XCiT-N12 模型所得的 92.2%92.2\%

关键词

引用

@article{arxiv.2111.10017,
  title  = {Rethinking Query, Key, and Value Embedding in Vision Transformer under Tiny Model Constraints},
  author = {Jaesin Ahn and Jiuk Hong and Jeongwoo Ju and Heechul Jung},
  journal= {arXiv preprint arXiv:2111.10017},
  year   = {2023}
}