中文

DialCLIP: 赋能CLIP作为多模态对话检索器

计算与语言 2024-01-04 v2

摘要

近年来,预训练视觉-语言模型的重大进展极大地增强了多模态对话系统的能力。这些模型通过在下游任务上进行微调,展示了显著的改进。然而,现有的预训练模型主要关注有效捕捉视觉和语言模态之间的对齐,往往忽略了对话上下文的复杂性质。在本文中,我们提出了一种参数高效的提示微调方法DialCLIP,用于多模态对话检索。具体来说,我们的方法引入了一个多模态上下文提示生成器来学习上下文特征,随后将这些特征蒸馏到预训练视觉-语言模型CLIP的提示中。此外,我们引入了领域提示以缓解与下游对话数据的差异。为了促进多种类型的检索,我们还设计了多个专家来学习从CLIP输出到多模态表示空间的映射,每个专家负责一种特定的检索类型。大量实验表明,DialCLIP通过仅调整总参数的0.04%,在两个广泛认可的基准数据集(即PhotoChat和MMDialog)上达到了最先进的性能。这些结果凸显了我们方法的有效性和高效性,并强调了其在推进多模态对话检索领域的潜力。

关键词

引用

@article{arxiv.2401.01076,
  title  = {DialCLIP: Empowering CLIP as Multi-Modal Dialog Retriever},
  author = {Zhichao Yin and Binyuan Hui and Min Yang and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2401.01076},
  year   = {2024}
}

备注

ICASSP 2024