面向少样本视觉问答的元自适应提示蒸馏
人工智能
2026-03-03 v3 计算与语言
计算机视觉与模式识别
机器学习
摘要
大型多模态模型 (LMM) 常常依赖于基于少量监督信息的 in-context learning (ICL) 来执行新的视觉问答 (VQA) 任务。然而,尤其是较小的 LMM 来说,ICL 性能在增加示例数量时并不总是呈单调提高。我们假设这可能是由于 LMM 被与下游任务无关的图像嵌入中的冗余信息所淹没。为此,我们提出一种元学习方法,通过从任务相关的视觉特征中蒸馏出固定的一组软提示,使 LMM 具备少样本能力,这些软提示在测试时可通过少量示例进行自适应。我们通过注意力映射模块来实现此蒸馈,该模块可轻松集成到任何 LMM 架构中,并与软提示联合学习。在 VL-ICL Bench 上的评估显示,我们的方法成功地在低数据 regime 下仅通过少数梯度步骤即可实现任务适应,显著优于 ICL 提升了 21.2%。与参数高效微调方法的比较表明,元学习进一步通过 7.7% 提升了此类适应,适用于各种 VQA 任务。
引用
@article{arxiv.2506.06905,
title = {Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering},
author = {Akash Gupta and Amos Storkey and Mirella Lapata},
journal= {arXiv preprint arXiv:2506.06905},
year = {2026}
}
备注
ICLR 2026