中文

面向融合式视觉语言预训练模型的同步双模态提示调优 (SDPT)

计算机视觉与模式识别 2024-07-17 v1

摘要

提示调优方法在大型预训练模型的参数高效微调方面取得了显著成果。然而, 其应用于基于双模态融合的视觉语言预训练模型 (VLPMs) 如 GLIP 时, 存在问题。现有提示调优方法未能有效解决不同模态 token 的映射与对齐问题, 导致迁移泛化性能差。为此提出同步双模态提示调优 (SDPT)。SDPT 在已建立的模态对齐空间中初始化一套可学习的统一原型 token, 以代表文本和图像模态在下游任务中对齐语义。进一步构建无需训练的逆线性投影, 将统一原型 token 的信息嵌入到不同模态的输入空间。逆线性投影使得统一原型 token 能同步代表两种模态, 从而使 SDPT 能在不同模态提示下共享文本和图像的统一语义。实验结果表明, SDPT 仅占用 0.04% 的模型参数, 即可在各种场景下为融合式 VLPMs 带来优异性能, 超越单模态或双模态方法。代码将在 https://github.com/wuyongjianCODE/SDPT 发布。

关键词

引用

@article{arxiv.2407.11414,
  title  = {SDPT: Synchronous Dual Prompt Tuning for Fusion-based Visual-Language Pre-trained Models},
  author = {Yang Zhou and Yongjian Wu and Jiya Saiyin and Bingzheng Wei and Maode Lai and Eric Chang and Yan Xu},
  journal= {arXiv preprint arXiv:2407.11414},
  year   = {2024}
}

备注

Accepted by ECCV 2024