中文

面向多模态统一模型的轻量级上下文微调

计算机视觉与模式识别 2023-10-10 v1

摘要

上下文学习(ICL)指从给定上下文示例中推理。随着模态增多,该过程愈发具挑战性,因为交错输入的模态使理解过程复杂化。多模态模型常难以有效地从上下文示例外推以执行ICL,即为例证。为应对这些挑战,我们引入多模态上下文微调(M2^2IXT),一种增强多模态统一模型ICL能力的轻量级模块。所提M2^2IXT模块感知可扩展的上下文窗口以纳入多模态(如文本、图像和坐标)的各类标注示例。它可前置至不同架构的多种多模态统一模型(如OFA、Unival、LLaVA),并通过混合任务策略训练,以实现在多个任务和数据集上的快速小样本适配。当仅用少至50K多模态数据微调时,M2^2IXT可显著提升小样本ICL性能(如OFA相对提升18%),并在视觉问答、图像描述、视觉定位和视觉蕴含等一系列任务上取得最先进结果,同时模型参数量极小(如比Flamingo或MMICL小约20×20\times),凸显了M2^2IXT作为多模态上下文学习器的灵活性与有效性。

关键词

引用

@article{arxiv.2310.05109,
  title  = {Lightweight In-Context Tuning for Multimodal Unified Models},
  author = {Yixin Chen and Shuai Zhang and Boran Han and Jiaya Jia},
  journal= {arXiv preprint arXiv:2310.05109},
  year   = {2023}
}

备注

Preprint