MM-Prompt:面向持续视觉问答的跨模态提示微调
计算机视觉与模式识别
2025-09-12 v2 人工智能
机器学习
摘要
基于预训练模型(PTMs)的持续视觉问答(CVQA)通过利用提示微调实现持续多模态学习,取得了可喜的进展。然而,现有大多数方法采用跨模态提示隔离,分别构建视觉和文本提示,这加剧了模态不平衡并导致性能随时间下降。为解决此问题,我们提出了 MM-Prompt,一个融合跨模态提示查询和跨模态提示恢复的新框架。前者通过在查询形成过程中引入跨模态信号实现平衡的提示选择,而后者在迭代跨模态交互的引导下,通过一个对齐损失来防止表征漂移,从而促进联合提示重构。大量实验表明,MM-Prompt 在准确性和知识保持方面超越了现有方法,同时在持续学习过程中保持了平衡的模态参与度。
引用
@article{arxiv.2505.19455,
title = {MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering},
author = {Xu Li and Fan Lyu},
journal= {arXiv preprint arXiv:2505.19455},
year = {2025}
}