中文

通过任务感知示范提升大型视觉语言模型中多模态情境学习能力

计算机视觉与模式识别 2025-04-08 v2 人工智能 计算与语言

摘要

多模态情境学习 (ICL) 已成为大型视觉语言模型 (LVLMs) 的关键能力,得益于其规模不断增大且适用性提升。尽管前景广阔,但在多模态环境下实现有效的 ICL 仍面临挑战,原因在于图像-文本输入的内在复杂性以及情境学习性能对输入配置高度敏感。本文揭示了多模态 ICL 核心机制,确定任务映射是配置稳健情境演示 (ICD) 序列的关键因素。基于这些洞见,我们提出了 \textit{SabER},一种轻量且功能强大的仅解码器 Transformer,配备任务感知注意力机制,能以自回归方式智能选择并排列演示库中的 ICD。这种设计实现了细粒度特征提取和跨模态推理,迭代细化任务映射以生成高质量的 ICD 序列。通过覆盖五个 LVLMs 和九个基准数据集的广泛实验,SabER 不仅展示了强大的实证性能,还提供了深入理解任务语义如何与多模态 ICD 交互的机制。我们的发现凸显了原则化 ICD 序列配置的重要性,为在广泛实际场景中增强多模态 ICL 开辟了新路径。

关键词

引用

@article{arxiv.2503.04839,
  title  = {Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations},
  author = {Yanshu Li},
  journal= {arXiv preprint arXiv:2503.04839},
  year   = {2025}
}

备注

Accepted by ICLR 2025 Workshop on Reasoning and Planning for LLMs, 25 pages, 13 tables