受记忆启发的时序提示交互用于文本-图像分类
计算机视觉与模式识别
2024-01-29 v1 人工智能
摘要
近年来,大规模预训练多模态模型 (LMM) 普遍兴起,融合了视觉和语言模态,在各类自然语言处理和计算机视觉任务中取得了显著成功。然而,LMM 规模的不断增长导致为下游任务微调这些模型的计算成本高昂。因此,基于提示的交互策略被研究以更高效地对齐模态。在此背景下,我们提出了一种受人类记忆策略启发的新型基于提示的多模态交互策略,即受记忆启发的时序提示交互 (MITP)。我们提出的方法包含两个阶段,如同人类记忆策略:获取阶段,以及巩固和激活阶段。我们利用中间层上的时序提示来模拟获取阶段,利用基于相似性的提示交互来模拟记忆巩固,并采用提示生成策略来模拟记忆激活。我们论文的主要优势在于,我们在中间层上交互提示向量,以充分利用模态间的信息交换,同时压缩了可训练参数和内存使用。我们在多个数据集上取得了具有竞争力的结果,且内存使用相对较小,可训练参数仅为 2.0M(约占预训练基础模型的 1%)。
引用
@article{arxiv.2401.14856,
title = {Memory-Inspired Temporal Prompt Interaction for Text-Image Classification},
author = {Xinyao Yu and Hao Sun and Ziwei Niu and Rui Qin and Zhenjia Bai and Yen-Wei Chen and Lanfen Lin},
journal= {arXiv preprint arXiv:2401.14856},
year = {2024}
}