面向多模态统一模型的轻量级上下文微调
计算机视觉与模式识别
2023-10-10 v1
摘要
上下文学习(ICL)指从给定上下文示例中推理。随着模态增多,该过程愈发具挑战性,因为交错输入的模态使理解过程复杂化。多模态模型常难以有效地从上下文示例外推以执行ICL,即为例证。为应对这些挑战,我们引入多模态上下文微调(MIXT),一种增强多模态统一模型ICL能力的轻量级模块。所提MIXT模块感知可扩展的上下文窗口以纳入多模态(如文本、图像和坐标)的各类标注示例。它可前置至不同架构的多种多模态统一模型(如OFA、Unival、LLaVA),并通过混合任务策略训练,以实现在多个任务和数据集上的快速小样本适配。当仅用少至50K多模态数据微调时,MIXT可显著提升小样本ICL性能(如OFA相对提升18%),并在视觉问答、图像描述、视觉定位和视觉蕴含等一系列任务上取得最先进结果,同时模型参数量极小(如比Flamingo或MMICL小约),凸显了MIXT作为多模态上下文学习器的灵活性与有效性。
引用
@article{arxiv.2310.05109,
title = {Lightweight In-Context Tuning for Multimodal Unified Models},
author = {Yixin Chen and Shuai Zhang and Boran Han and Jiaya Jia},
journal= {arXiv preprint arXiv:2310.05109},
year = {2023}
}
备注
Preprint