面向多Shot多模态In-Context学习的敏感感知任务向量
人工智能
2025-11-12 v1
摘要
大型多模态模型(LMMs)在上下文学习(ICL)方面表现出前景,但在扩展到大量Shot设置时仍面临上下文长度有限和高推理成本的挑战。为此,已探索基于任务向量的方法,通过插入大量上下文演示的紧凑表示来插入模型激活中。然而,现有的任务向量方法要么忽视插入位置的重要性,要么难以确定每个位置的合适值。为此,我们提出一种新的敏感感知任务向量插入框架(STV),以确定插入位置和插入内容。我们的关键洞察是,查询-上下文对之间的激活delta在结构上表现出一致模式,为插入提供可靠线索。基于识别到的敏感感知位置,我们为每个位置构建经过聚类的激活银行,然后应用强化学习来选择最合适的插入值。我们在各种多模态模型(如Qwen-VL、Idefics-2)和任务(如VizWiz、OK-VQA)上进行评估,展示了其有效性,并表明在强大的泛化能力下,相对于以前的任务向量方法均实现了一致的改进。
引用
@article{arxiv.2511.08246,
title = {Where and What Matters: Sensitivity-Aware Task Vectors for Many-Shot Multimodal In-Context Learning},
author = {Ziyu Ma and Chenhui Gou and Yiming Hu and Yong Wang and Xiangxiang Chu and Bohan Zhuang and Jianfei Cai},
journal= {arXiv preprint arXiv:2511.08246},
year = {2025}
}
备注
Accepted by AAAI 2026