揭示图像描述中有效 In-Context 配置的有效性:外部与内部分析
计算与语言
2025-07-14 v1 人工智能
摘要
大模型的演进见证了 In-Context Learning (ICL) 能力的涌现。在自然语言处理 (NLP) 领域,已有众多研究证明 ICL 的有效性。鼓舞大语言模型 (LLM) 的成功,研究者们开发了具备 ICL 能力的大型多模态模型 (LMM)。然而,对多模态 ICL 的演示配置仍处于探索初期。此外,In-Context Examples (ICEs) 的可控性为观察和分析 LMM 在不同输入下的推理特征提供了高效且成本效益显著的手段。本文对多模态 In-Context Learning 在图像描述任务上的表现进行了全面的外部与内部考察。外部方面,我们通过三个维度探索演示配置策略:样本数量、图像检索和标题分配。我们运用多种指标,对关键发现进行系统性、彻底的评估并进行总结。内部方面,我们分析典型 LMM 的注意力特征,构建基于注意力的指标以量化模型行为。我们还进行辅助实验,探讨注意力驱动的模型加速和压缩的可行性。我们进一步比较了采用相同模型设计和预训练策略的 LMM 的性能差异,并从预训练数据特征的角度进行解释。我们的研究揭示了 ICEs 配置策略如何通过外部实验影响模型性能,以及内部检查揭示的典型模式,为理解 LMM 中的多模态 ICL 提供了双重视角。我们的方法将外部与内部分析相结合,以探索大模型,以及我们新提出的指标,可适用于更广泛的研究领域。
引用
@article{arxiv.2507.08021,
title = {Unveiling Effective In-Context Configurations for Image Captioning: An External & Internal Analysis},
author = {Li Li and Yongliang Wu and Jingze Zhu and Jiawei Peng and Jianfei Cai and Xu Yang},
journal= {arXiv preprint arXiv:2507.08021},
year = {2025}
}
备注
16 pages, 11 figures