中文

MMICT:利用上下文示例增强多模态微调

人工智能 2024-08-13 v3 计算与语言 机器学习

摘要

尽管上下文学习(In-Context Learning, ICL)为大型语言模型(LLMs)带来了显著的性能提升,但其改进幅度仍低于在下游任务上的微调。本文提出了多模态上下文微调(Multi-Modal In-Context Tuning, MMICT),这是一种新颖的多模态微调范式,通过充分利用多模态LLMs(MM-LLMs)有前景的ICL能力来增强多模态微调。我们提出了多模态中心(Multi-Modal Hub, M-Hub),这是一个统一的模块,可根据不同的输入和目标捕获各种多模态特征。基于M-Hub,MMICT使MM-LLMs能够从上下文视觉引导的文本特征中学习,并随后生成以文本引导的视觉特征为条件的输出。此外,利用M-Hub的灵活性,我们设计了多种上下文示例。在广泛的下游多模态任务上进行的大量实验表明,MMICT显著优于传统的微调策略和直接将不同模态的所有信息拼接作为输入的普通ICT方法。我们的实现代码可在以下地址获取:https://github.com/KDEGroup/MMICT。

关键词

引用

@article{arxiv.2312.06363,
  title  = {MMICT: Boosting Multi-Modal Fine-Tuning with In-Context Examples},
  author = {Tao Chen and Enwei Zhang and Yuting Gao and Ke Li and Xing Sun and Yan Zhang and Hui Li and Rongrong Ji},
  journal= {arXiv preprint arXiv:2312.06363},
  year   = {2024}
}

备注

TOMM 2024