中文

面向多模态语义理解的混合提示专家

计算与语言 2024-03-26 v2 多媒体

摘要

超越仅挖掘表层内容关系的深度多模态语义理解在人工智能领域受到越来越多的关注。收集和标注高质量多模态数据的挑战凸显了少样本学习的重要性。本文关注此背景下的两个关键任务:少样本多模态讽刺检测(MSD)和多模态情感分析(MSA)。为解决这些任务,我们提出了基于块感知提示融合的混合提示专家,这是一种基于统一视觉语言模型(VLM)的新型多模态软提示框架。具体而言,我们设计了三种软提示专家:用于提取特定模态特征以丰富单模态表示的文本提示和图像提示,以及用于辅助多模态交互的统一提示。此外,我们将 Transformer 层重组为若干块,并在相邻块之间引入跨模态提示注意力,从而平滑了从单模态表示到多模态融合的过渡。在少样本设置下的 MSD 和 MSA 数据集上,我们提出的模型不仅仅以 2% 的参数量(150M)超越了 8.2B 参数的 InstructBLIP 模型,而且显著优于其他广泛使用的 VLM 提示方法或特定任务方法。

关键词

引用

@article{arxiv.2403.11311,
  title  = {Mixture-of-Prompt-Experts for Multi-modal Semantic Understanding},
  author = {Zichen Wu and Hsiu-Yuan Huang and Fanyi Qu and Yunfang Wu},
  journal= {arXiv preprint arXiv:2403.11311},
  year   = {2024}
}

备注

LREC-COLING 2024, Long Paper