基于 STAMINA 的连续扩散:堆叠与掩码增量适配器
计算机视觉与模式识别
2024-05-06 v2 人工智能
机器学习
摘要
近期工作展示了以连续(即持续)方式定制文本到图像扩散模型以适配多个细粒度概念的非凡能力,且每个概念仅提供少量示例图像。该设定被称为连续扩散。在此,我们提出一个问题:能否将这些方法扩展到更长概念序列而不遗忘?尽管先前工作缓解了已学概念的遗忘,我们表明其在更长序列上学习新任务的能力趋于饱和。我们通过引入一种新方法——堆叠与掩码增量适配器(STack-And-Mask INcremental Adapters, STAMINA)来解决此挑战,其由低秩注意力掩码适配器与定制化 MLP 令牌组成。STAMINA 旨在通过可学习的硬注意力掩码(由低秩 MLP 参数化)增强 LoRA 在序列概念学习中的鲁棒微调特性,从而实现通过稀疏适配的精确、可扩展学习。值得注意的是,所有引入的可训练参数在训练后均可折回模型中,不产生额外推理参数开销。我们表明,在由地标与人脸构成的 50-概念基准上,STAMINA 优于先前文本到图像连续定制的 SOTA,且无需存储回放数据。此外,我们将方法扩展到图像分类的连续学习设定,证明我们的增益同样转化为该标准基准上的最先进性能。
引用
@article{arxiv.2311.18763,
title = {Continual Diffusion with STAMINA: STack-And-Mask INcremental Adapters},
author = {James Seale Smith and Yen-Chang Hsu and Zsolt Kira and Yilin Shen and Hongxia Jin},
journal= {arXiv preprint arXiv:2311.18763},
year = {2024}
}
备注
CVPR-W 2024