中文

描述、生成、持续:利用预训练生成式视觉-语言模型进行持续学习

机器学习 2025-11-14 v2

摘要

持续学习(CL)使模型能够适应不断变化的数据流而不会灾难性遗忘,这是现实世界 AI 系统的基本要求。然而,当前的方法通常依赖于大型重放缓冲区或大量标注的数据集,由于存储、隐私和成本限制,这些方法是不切实际的。我们提出了 CLTS(通过文本-图像协同的持续学习),这是一种新颖的类增量框架,可以在不存储真实任务数据的情况下减轻遗忘。CLTS 利用预训练的视觉-语言模型 BLIP(引导语言-图像预训练)进行描述生成,以及稳定扩散进行样本生成。每个任务由一个专用的任务头处理,而任务路由器学习使用生成的数据将输入分配到正确的任务头。在三个基准数据集上,与四个最近的持续学习基线相比,CLTS 将平均任务准确率提高了高达 54%,并实现了 63 倍的更好内存效率,展示了改进的保留和适应性。CLTS 通过集成生成式文本-图像增强为可扩展的持续学习引入了一个新颖的视角。

关键词

引用

@article{arxiv.2409.17806,
  title  = {Caption, Create, Continue: Continual Learning with Pre-trained Generative Vision-Language Models},
  author = {Indu Solomon and Aye Phyu Phyu Aung and Uttam Kumar and Senthilnath Jayavelu},
  journal= {arXiv preprint arXiv:2409.17806},
  year   = {2025}
}

备注

This is the revised and peer-reviewed version of our paper, accepted and published in the Proceedings of the 34th ACM International Conference on Information and Knowledge Management (CIKM 2025)