中文

用于多模态融合的条件提示微调

计算与语言 2023-12-08 v1 人工智能

摘要

我们表明,一种模态的表示可以有效引导另一种模态的提示,以实现参数高效的多模态融合。具体而言,我们首先对一种模态进行编码,并将其表示作为先验,对另一模态的所有冻结层进行条件提示。这是通过将普通提示向量解耦为三种类型的专用提示来实现的,这些提示自适应地捕获全局级和实例级特征。为了更好地生成实例级提示,我们引入了提示专家混合(MoPE),以将每个实例动态路由到最合适的提示专家进行编码。我们进一步研究了一个正则化项,以避免退化的提示专家路由。得益于我们的设计,我们的方法可以有效地将单模态编码器中的预训练知识转移到下游多模态任务中。与普通提示相比,我们表明基于MoPE的条件提示具有更强的表达能力,因此在训练数据和提示总数方面具有更好的扩展性。我们还证明了我们的提示微调与架构无关,从而提供了高度的模块化。在三个多模态数据集上的大量实验展示了最先进的结果,其性能与微调相当或超越微调,而仅需0.7%的可训练参数。代码将发布于:https://github.com/songrise/ConditionalPrompt。

关键词

引用

@article{arxiv.2312.03734,
  title  = {Conditional Prompt Tuning for Multimodal Fusion},
  author = {Ruixiang Jiang and Lingbo Liu and Changwen Chen},
  journal= {arXiv preprint arXiv:2312.03734},
  year   = {2023}
}

备注

under review