中文

Otter:一种具有上下文指令微调的多模态模型

计算机视觉与模式识别 2025-07-29 v2 计算与语言

摘要

大型多模态模型(LMMs)近期的进展已展现出作为视觉助手的巨大潜力。然而,大多数现有工作聚焦于响应单个指令或利用先前对话进行上下文理解。关于同时采用图像和文本作为上下文示例以增强指令跟随能力的研究甚少。为弥补这一差距,我们引入 \textbf{Otter} 模型,利用文本与视觉上下文示例进行指令微调。具体而言,Otter 构建于带有 Perceiver 架构的 Flamingo 之上,并已针对通用多模态助手进行了指令微调。Otter 无缝处理多模态输入,支持包括文本、多图像和动态视频内容在内的模态。为支持 Otter 的训练,我们提出 \textbf{MIMIC-IT}(\textbf{M}ult\textbf{I}-\textbf{M}odal \textbf{I}n-\textbf{C}ontext \textbf{I}nstruction \textbf{T}uning)数据集,其涵盖超过 300 万条多模态指令-响应对,包括跨广泛图像与视频谱的约 220 万条唯一指令。MIMIC-IT 经精心筛选,为每条目配备多样化的上下文示例。综合评估表明,使用这些上下文示例的指令微调显著增强了模型收敛与泛化能力。值得注意的是,MIMIC-IT 数据集提供的广泛场景覆盖使 Otter 模型在涉及复杂视频与多图像理解的任务中表现出色。

关键词

引用

@article{arxiv.2305.03726,
  title  = {Otter: A Multi-Modal Model with In-Context Instruction Tuning},
  author = {Bo Li and Yuanhan Zhang and Liangyu Chen and Jinghao Wang and Fanyi Pu and Joshua Adrian Cahyono and Jingkang Yang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2305.03726},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025