多模态任务向量实现多 shot多模态情境学习
计算机视觉与模式识别
2024-12-23 v3 人工智能
计算与语言
机器学习
摘要
最近的交叉式大型多模态模型(LMM)在few-shot学习方面取得了成功,表明在众多示例的情况下进行情境学习(ICL)具有前景。然而,这种many-shot多模态ICL设置存在一个关键问题:其本质上受限于预训练时模型的上下文长度。该问题在多模态领域尤为突出,因为该领域需要处理文本和图像,需额外的token数。这促使需要一种无需微调即可将众多shot压缩为更少token的多模态方法。本文通过利用多模态任务向量(MTV)——压缩存储在模型注意力头中的情境示例的紧凑隐式表示——使LMM能够进行多模态、many-shot情境学习。具体而言,我们首先证明了LMM中存在此类MTV,然后利用这些提取的MTV来实现各种视觉语言任务的many-shot情境学习。我们的实验表明,MTV能够随压缩shot的数量而提升性能,并能在无需额外推理上下文长度的情况下,对类似的out-of-domain任务进行泛化。代码:https://github.com/Brandon3964/MultiModal-Task-Vector。
引用
@article{arxiv.2406.15334,
title = {Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning},
author = {Brandon Huang and Chancharik Mitra and Assaf Arbelle and Leonid Karlinsky and Trevor Darrell and Roei Herzig},
journal= {arXiv preprint arXiv:2406.15334},
year = {2024}
}
备注
Published in NeurIPS 2024