哪些因素影响多模态上下文学习?深入探究
计算与语言
2024-10-29 v1 人工智能
计算机视觉与模式识别
摘要
近期,多模态上下文学习 (MM-ICL) 取得了快速进展并获得了显著成功,它能够在无需额外参数微调的情况下,在各种任务中实现卓越性能。然而,MM-ICL 有效性的内在规律仍有待深入探索。为了填补这一空白,本研究旨在探讨以下研究问题:“哪些因素影响 MM-ICL 的性能?”为此,我们使用 6 个视觉大语言模型和 20 种策略,对 MM-ICL 的三个核心步骤(包括示例检索、示例排序和提示构建)进行了大量实验。我们的发现强调了:(1) 用于示例检索的多模态检索器的必要性;(2) 示例内排序相较于示例间排序的重要性;(3) 通过提示中的引导性指令增强任务理解。我们希望本研究能作为未来研究中优化 MM-ICL 策略的基础指南。
引用
@article{arxiv.2410.20482,
title = {What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration},
author = {Libo Qin and Qiguang Chen and Hao Fei and Zhi Chen and Min Li and Wanxiang Che},
journal= {arXiv preprint arXiv:2410.20482},
year = {2024}
}
备注
Accepted at NeurIPS 2024