中文

TOAST:基于注意力引导的迁移学习

计算机视觉与模式识别 2023-07-12 v2 计算与语言 机器学习

摘要

迁移学习涉及将预训练模型适配到新的下游任务。然而,我们观察到当前的迁移学习方法往往无法聚焦于与任务相关的特征。在本工作中,我们探索为迁移学习重新聚焦模型注意力。我们提出自顶向下注意力引导(TOAST),一种新颖的迁移学习算法,其保持预训练主干冻结,在输出中选择与任务相关的特征,并将这些特征反馈给模型以将注意力引导至任务特定特征。仅通过重新聚焦注意力,TOAST 在多个迁移学习基准上取得了最先进的结果,同时具有极少的 tunable 参数。与全微调、LoRA 和提示微调相比,TOAST 在一系列细粒度视觉分类数据集上大幅提升了性能(例如,在 FGVC 上从 81.1% 提升至 86.2%)。TOAST 还在指令跟随语言生成上优于全微调的 Alpaca 和 Vicuna 模型。代码可在 https://github.com/bfshi/TOAST 获取。

关键词

引用

@article{arxiv.2305.15542,
  title  = {TOAST: Transfer Learning via Attention Steering},
  author = {Baifeng Shi and Siyu Gai and Trevor Darrell and Xin Wang},
  journal= {arXiv preprint arXiv:2305.15542},
  year   = {2023}
}

备注

Code is available at https://github.com/bfshi/TOAST