中文

注意干扰:在视觉语言模型的参数高效持续学习中保留预训练知识

计算机视觉与模式识别 2024-07-09 v1

摘要

本研究解决了域-类增量学习问题,这是一个现实但具有挑战性的持续学习场景,其中域分布和目标类别在不同任务间都会变化。为了处理这些多样化的任务,引入了预训练的视觉语言模型,因为它们具有很强的泛化能力。然而,这引发了一个新问题:预训练VLM中编码的知识在适应新任务时可能会受到干扰,从而损害其固有的零样本能力。现有方法通过在额外数据集上使用知识蒸馏来微调VLM来解决这个问题,但这需要大量的计算开销。为了高效地解决这个问题,我们提出了分布感知的无干扰知识集成框架,从避免信息干扰的角度保留VLM的预训练知识。具体来说,我们设计了一个完全残差机制,将新学到的知识注入冻结的主干网络,同时对预训练知识引入最小的影响。此外,这种残差特性使我们能够实现分布感知的集成校准方案,显式地控制对来自未见分布测试数据的信息植入过程。实验表明,我们的DIKI仅使用0.86%的训练参数,并需要显著更少的训练时间,就超越了当前最先进的方法。代码可在 https://github.com/lloongx/DIKI 获取。

关键词

引用

@article{arxiv.2407.05342,
  title  = {Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models},
  author = {Longxiang Tang and Zhuotao Tian and Kai Li and Chunming He and Hantao Zhou and Hengshuang Zhao and Xiu Li and Jiaya Jia},
  journal= {arXiv preprint arXiv:2407.05342},
  year   = {2024}
}

备注

ECCV 2024