先重构后查询:基于分解提示协作的持续缺失模态学习
计算机视觉与模式识别
2024-03-19 v1
摘要
预训练的大型多模态模型(LMMs)利用微调来适应多样的用户应用。然而,由于传感器被停用(例如出于隐私或技术问题关闭相机),微调可能面临挑战,产生模态不完整数据,并导致训练数据与推理数据不一致。此外,持续训练会导致灾难性遗忘,稀释预训练LMMs中的知识。为了克服这些挑战,我们引入了一项新任务——持续缺失模态学习(CMML),以研究模型在持续微调期间当某些模态数据缺失时如何泛化。我们的初步基准测试表明,现有方法在CMML中性能显著下降,即使有先进的持续学习技术的辅助。因此,我们设计了一个名为先重构后查询(RebQ)的框架。它将提示分解为特定模态的提示,并将其拆分为组件存储在可通过键-查询机制访问的池中,这促进了参数高效微调并增强了后续任务的知识可迁移性。同时,我们的RebQ利用预训练LMMs中丰富的多模态知识来重构缺失模态的数据。综合实验表明,RebQ有效地重构了缺失模态信息并保留了预训练知识。具体而言,与基线相比,RebQ将平均精度从20.00提高到50.92,并将平均遗忘从75.95降低到8.56。代码和数据集可在 https://github.com/Tree-Shu-Zhao/RebQ.pytorch 获取。
引用
@article{arxiv.2403.11373,
title = {Reconstruct before Query: Continual Missing Modality Learning with Decomposed Prompt Collaboration},
author = {Shu Zhao and Xiaohan Zou and Tan Yu and Huijuan Xu},
journal= {arXiv preprint arXiv:2403.11373},
year = {2024}
}