表征在网络中:面向大规模模型的可组合与并行适配
机器学习
2023-11-01 v2 计算机视觉与模式识别
摘要
我们提出 InCA,一种用于迁移学习的轻量级方法,它对预训练模型的任意激活层进行交叉注意力(cross-attention)。在训练期间,InCA 使用单次前向传播提取多个激活,并将其传递给外部交叉注意力适配器,这些适配器重新训练并针对下游任务进行组合或选择。我们表明,即使仅选择单个得分最高的适配器,InCA 也能达到与全量微调相当的性能,而成本仅相当于微调最后一层。例如,使用一个大小为预训练 ViT-L/16 模型 1.3% 的交叉注意力探针,在 11 个下游分类任务的平均计算训练成本仅为基线的 51% 的情况下,我们达到了与全量微调基准相差 0.2% 以内的性能。与其他高效适配形式不同,InCA 不需要通过预训练模型反向传播,从而使其在训练和推理时的执行保持不变。InCA 的通用性在细粒度任务中体现得最为明显,这类任务可能需要访问最后一层中缺失但中间层激活中可获取的信息。由于主干网络固定,InCA 允许并行集成以及多个任务的并行执行。InCA 在 ImageNet-to-Sketch 多任务基准上取得了最先进的(state-of-the-art, SOTA)性能。
引用
@article{arxiv.2303.04105,
title = {Your representations are in the network: composable and parallel adaptation for large scale models},
author = {Yonatan Dukler and Alessandro Achille and Hao Yang and Varsha Vivek and Luca Zancato and Benjamin Bowman and Avinash Ravichandran and Charless Fowlkes and Ashwin Swaminathan and Stefano Soatto},
journal= {arXiv preprint arXiv:2303.04105},
year = {2023}
}
备注
Accepted to NeurIPS 2023