MuDPT:面向大型预训练视觉-语言模型的多模态深度联合提示微调
计算机视觉与模式识别
2024-07-16 v2 计算与语言
摘要
随着 CLIP 等大型预训练视觉-语言模型的出现,像 CoOp 这样的提示微调在各种下游任务中展现出了有前景的视觉识别和迁移学习能力。然而,我们发现现有的单模态提示微调方法可能导致次优性能,因为这种单模态设计破坏了预训练模型中文本和视觉表示的原始对齐。受预训练视觉-语言模型本质的启发,我们旨在实现提示微调的完整性,并提出了一种称为多模态深度联合提示微调的新方法,简称 MuDPT。该方法通过额外学习一个与模型无关的转换网络来实现深度分层双向提示融合,从而扩展了独立的多模态提示微调。我们在少样本视觉识别和域外泛化任务上评估了 MuDPT 的有效性。得益于文本和视觉表示的协同对齐,与 SOTA 方法相比,MuDPT 以明显的优势取得了更好的识别和泛化能力。我们的代码可在以下网址获取:https://github.com/Mechrev0/MuDPT。
引用
@article{arxiv.2306.11400,
title = {MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models},
author = {Yongzhu Miao and Shasha Li and Jintao Tang and Ting Wang},
journal= {arXiv preprint arXiv:2306.11400},
year = {2024}
}
备注
The paper has been accepted by ICME 2023