微小模型约束下视觉Transformer中查询、键与值嵌入的重新思考
计算机视觉与模式识别
2023-05-01 v1
摘要
视觉 Transformer(ViT)是计算机视觉领域的主导模型。尽管大量研究主要关注处理归纳偏置与复杂度问题,寻找更优 Transformer 网络的问题依然存在。例如,传统的基于 Transformer 的模型通常在多头自注意力之前对每个查询(Q)、键(K)和值(V)嵌入使用一个投影层。对语义 Q、K 和 V 嵌入考虑不足可能导致性能下降。在本文中,我们提出三种用于 Q、K 和 V 嵌入的结构。第一种结构利用带 ReLU 的两层,这是一种用于 Q、K 和 V 的非线性嵌入。第二种涉及共享其中一个非线性层以在 Q、K 和 V 之间共享知识。第三种提出的结构通过代码参数共享所有非线性层。这些代码是可训练的,其数值决定了要在 Q、K 和 V 之间执行的嵌入过程。因此,我们在实验中展示了所提方法相较于若干 SOTA 方法的更优图像分类性能。所提方法在 ImageNet-1k 数据集上以少量参数()取得了 的准确率,而原始 Transformer 模型 XCiT-N12 需达到 。此外,该方法在 CIFAR-10、CIFAR-100、Stanford Cars 数据集和 STL-10 数据集的迁移学习上平均仅用 参数取得了 的准确率,优于原始 XCiT-N12 模型所得的 。
引用
@article{arxiv.2111.10017,
title = {Rethinking Query, Key, and Value Embedding in Vision Transformer under Tiny Model Constraints},
author = {Jaesin Ahn and Jiuk Hong and Jeongwoo Ju and Heechul Jung},
journal= {arXiv preprint arXiv:2111.10017},
year = {2023}
}