StochCA:一种利用交叉注意力挖掘预训练模型的新方法
计算机视觉与模式识别
2024-10-01 v2
摘要
利用大规模预训练模型是提升各种目标任务性能的众所周知策略。通常通过微调预训练模型在目标任务上实现。然而,简单的微调可能无法充分利用预训练模型中嵌入的知识。在本研究中,我们引入了一种新颖的微调方法,称为随机交叉注意力(StochCA),专门针对Transformer架构。该方法修改了Transformer的自注意力机制,以在微调过程中选择性地利用预训练模型的知识。具体来说,在每个块中,根据预定义的概率随机执行交叉注意力而不是自注意力,其中键和值从预训练模型的对应块中提取。通过这种方式,目标模型的查询和通道混合多层感知器层被微调到目标任务,以学习如何有效利用预训练模型的丰富表示。为了验证StochCA的有效性,我们在迁移学习和领域泛化的基准上进行了广泛实验,这些领域中对预训练模型的利用至关重要。我们的实验结果表明,StochCA在这两个领域都优于最先进的方法。此外,我们证明StochCA与现有方法互补,即可以与之结合以进一步提高性能。我们的代码可在https://github.com/daintlab/stochastic_cross_attention获取。
引用
@article{arxiv.2402.16092,
title = {StochCA: A Novel Approach for Exploiting Pretrained Models with Cross-Attention},
author = {Seungwon Seo and Suho Lee and Sangheum Hwang},
journal= {arXiv preprint arXiv:2402.16092},
year = {2024}
}
备注
The updated version was published in Neural Networks (https://www.sciencedirect.com/science/article/abs/pii/S0893608024005872). The first two authors contributed equally