中文

ModalPrompt: 面向高效多模态持续指令微调的双模态引导提示学习

计算机视觉与模式识别 2025-08-26 v2

摘要

大型多模态模型通过学习混合指令数据集展现出卓越的多任务能力。然而,在动态世界中,新任务会按顺序出现,这要求为大型多模态模型配备多模态持续指令学习能力,尤其是针对多样且具有挑战性的生成任务。现有的多模态持续指令学习方法未能充分利用大型多模态模型的独特属性,且往往以牺牲效率为代价来提升性能。本文提出了一种新颖的提示学习框架用于多模态持续指令学习,该框架在利用自然图像-文本监督管理计算复杂度的同时,有效缓解了对先前知识的遗忘。具体而言,我们为每个任务学习提示,并利用高效提示融合进行知识迁移,以及通过双模态引导进行提示选择以管理复杂度。大量实验表明,我们的方法在多模态持续指令学习基准测试上实现了显著的+14.26%性能提升,推理速度提升了1.42倍,且计算量不会增长。代码开源于 https://github.com/AuroraZengfh/ModalPrompt。

关键词

引用

@article{arxiv.2410.05849,
  title  = {ModalPrompt: Towards Efficient Multimodal Continual Instruction Tuning with Dual-Modality Guided Prompt},
  author = {Fanhu Zeng and Fei Zhu and Haiyang Guo and Xu-Yao Zhang and Cheng-Lin Liu},
  journal= {arXiv preprint arXiv:2410.05849},
  year   = {2025}
}

备注

EMNLP 2025 (Main Conference)