从内省到最佳实践:多模态 in-context 学习演示的原则性分析
计算机视觉与模式识别
2025-02-10 v3 人工智能
计算与语言
机器学习
摘要
受大型语言模型(LLM) in-context 学习能力的启发,具备额外视觉模态的多模态 LLM 在提供多个图像-文本配对演示时也展现出类似的 in-context 能力。然而,针对多模态 in-context 学习工作原理的探讨相对较少。我们对不同规模模型在广泛新颖且关键任务上的多模态 in-context 学习进行系统而原则性的评估。通过对不同模态信息的扰动,我们展示模态在不同任务中影响不同。依据任务特定的模态影响,我们推荐基于模态的演示策略以提升 in-context 学习性能。我们还发现模型可能从多模态 in-context 学习中遵循 inductive bias,即使这些 bias 在很少见于或与预训练数据的语义先验相矛盾。我们的原则性分析为理解多模态 in-context 学习中演示的作用提供了全面方法,并为在广泛任务上有效提升多模态 in-context 学习指明了方向。
引用
@article{arxiv.2407.00902,
title = {From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning},
author = {Nan Xu and Fei Wang and Sheng Zhang and Hoifung Poon and Muhao Chen},
journal= {arXiv preprint arXiv:2407.00902},
year = {2025}
}
备注
NAACL 2025