VL-ICL Bench:多模态上下文学习中的细节魔鬼
机器学习
2025-04-02 v4
摘要
大型语言模型(LLM)著名地表现出涌现的上下文学习(ICL)能力——即利用作为提示提供的少样本示例快速适应新任务的能力,而无需更新模型权重。建立在 LLM 之上的视觉大型语言模型(VLLM)在识别、推理和定位等领域取得了显著进展。然而,对多模态 ICL 的研究主要集中在少样本视觉问答(VQA)和图像描述上,我们将证明这两者既未发挥 ICL 的优势,也未测试其局限性。多模态 ICL 更广泛的能力和局限性仍有待探索。在本研究中,我们引入了一个用于多模态上下文学习的综合基准 VL-ICL Bench,它涵盖了广泛的任务,这些任务以图像和文本作为输入和输出,并包含从感知到推理以及长上下文长度的不同类型的挑战。我们针对该基准套件评估了 SOTA VLLM 的能力,揭示了它们多样的优势和弱点,并表明即使是 GPT-4 等最先进的模型也会发现这些任务具有挑战性。通过突出一系列新的 ICL 任务以及现有模型相关的优势和局限性,我们希望我们的数据集能激励未来关于增强 VLLM 上下文学习能力的研究,并启发利用 VLLM ICL 的新应用。代码和数据集可在 https://github.com/ys-zong/VL-ICL 获取。
引用
@article{arxiv.2403.13164,
title = {VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning},
author = {Yongshuo Zong and Ondrej Bohdal and Timothy Hospedales},
journal= {arXiv preprint arXiv:2403.13164},
year = {2025}
}
备注
ICLR 2025