多模态大语言模型能否真正执行多模态上下文学习?
计算机视觉与模式识别
2024-12-10 v2 人工智能
机器学习
摘要
具有上下文学习(in-context learning, ICL)能力的大语言模型(LLMs)可在给定少量演示(demos)时快速适应特定上下文。近来,构建于 LLM 之上的多模态大语言模型(MLLMs)也展现出多模态 ICL 能力,即给定少量包含图像、查询与答案的多模态演示来回应查询。尽管 ICL 已在 LLM 上被广泛研究,其在 MLLM 上的研究仍有限。一个本质问题是这些 MLLM 能否真正进行多模态 ICL,还是仅文本模态即为必需。我们通过考察影响 ICL 的两个主要因素来研究该问题:1)演示内容,即理解不同模态中演示内容的影响;2)演示选择策略,即如何选取更好的多模态演示以提升性能。实验揭示多模态 ICL 主要由文本内容驱动,而演示中的视觉信息影响甚微。有趣的是,视觉内容对于选取演示以提升性能仍必要且有用。受我们的分析启发,我们提出一种简单而有效的方法,称为混合模态上下文示例选择(Mixed Modality In-Context Example Selection, MMICES),在选取演示时同时考虑视觉与语言模态。我们进行了大量实验以支持我们的发现并验证所提方法带来的改进。代码见 \url{https://chenxshuo.github.io/m-icl/}。
引用
@article{arxiv.2311.18021,
title = {Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?},
author = {Shuo Chen and Zhen Han and Bailan He and Jianzhe Liu and Mark Buckley and Yao Qin and Philip Torr and Volker Tresp and Jindong Gu},
journal= {arXiv preprint arXiv:2311.18021},
year = {2024}
}
备注
accepted by WACV2025