中文

哪些因素影响多模态上下文学习?深入探究

计算与语言 2024-10-29 v1 人工智能 计算机视觉与模式识别

摘要

近期,多模态上下文学习 (MM-ICL) 取得了快速进展并获得了显著成功,它能够在无需额外参数微调的情况下,在各种任务中实现卓越性能。然而,MM-ICL 有效性的内在规律仍有待深入探索。为了填补这一空白,本研究旨在探讨以下研究问题:“哪些因素影响 MM-ICL 的性能?”为此,我们使用 6 个视觉大语言模型和 20 种策略,对 MM-ICL 的三个核心步骤(包括示例检索、示例排序和提示构建)进行了大量实验。我们的发现强调了:(1) 用于示例检索的多模态检索器的必要性;(2) 示例内排序相较于示例间排序的重要性;(3) 通过提示中的引导性指令增强任务理解。我们希望本研究能作为未来研究中优化 MM-ICL 策略的基础指南。

关键词

引用

@article{arxiv.2410.20482,
  title  = {What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration},
  author = {Libo Qin and Qiguang Chen and Hao Fei and Zhi Chen and Min Li and Wanxiang Che},
  journal= {arXiv preprint arXiv:2410.20482},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024