通过探索-开发在情境学习中挑起多模态少样本大型视觉语言模型
计算机视觉与模式识别
2025-06-12 v1
摘要
情境学习(in-context learning, ICL)是指令学习中的一种主要趋势,旨在通过提供清晰的任务指导和示例来提升大型语言模型的性能,增强其任务理解与执行能力。本文聚焦于大型视觉语言模型(LVLMs)上的情境学习,探讨多模态演示选择的策略。现有ICL研究面临两个主要挑战:其一,依赖预定义演示或基于人类直觉的启发式选择策略,往往难以覆盖多样化的任务需求,导致解决方案次优;其二,逐个选择演示时无法建模其之间的相互作用,造成信息冗余。与这些主流做法不同,我们提出了一种新的探索-开发强化学习框架,通过自我探索持续细化演示来优化自身,实现对情境学习中最有效选择策略的自主识别与生成。实验结果表明,我们的方法在四个视觉问答(VQA)数据集上实现了卓越的性能,显著提升了少样本LVLMs的泛化能力。
引用
@article{arxiv.2506.09473,
title = {Provoking Multi-modal Few-Shot LVLM via Exploration-Exploitation In-Context Learning},
author = {Cheng Chen and Yunpeng Zhai and Yifan Zhao and Jinyang Gao and Bolin Ding and Jia Li},
journal= {arXiv preprint arXiv:2506.09473},
year = {2025}
}
备注
10 pages, 6 figures, CVPR 2025