中文

面向高效与精细化多模态零样本学习的 M$^2$IV:通过表示工程

计算机视觉与模式识别 2025-08-27 v3 人工智能

摘要

多模态零样本学习(ICL)为大型视觉语言模型(LVLMs)提供了通过多个用户提供的示例来适应新任务的能力,而无需进行模型参数更新。然而,其有效性受限于多模态输入的 token 密集特性以及跨模态少样本推理的复杂性,这些因素共同阻碍了LVLMs从示例中提取有用模式。为此,我们提出了M2^2IV,一种新型表示工程方法,用一组可学习的多模态情境向量直接注入LVLMs的残差流中,以取代显式的 token 级示例。通过分析多头注意力(MHA)和多层感知机(MLP)在ICL过程中的不同作用,我们设计了训练策略,使M2^2IV能够进行细粒度语义蒸馏和稳健的跨模态表示学习。M2^2IV不仅在不同任务和LVLMs之间提升性能,还显著降低了 token 开销,使其能够优雅地扩展到大规模零样本场景。为进一步提升可用性,我们引入了VLibrary—a 个存储已训练M2^2IV的仓库,可灵活检索和注入。通过VLibrary,用户可以以满足多样化需求的自定义方式引导预训练LVLMs。广泛的实验表明,M2^2IV consistently优于基础ICL和先前的表示工程基线,平均准确率提升3.74%,并在整体效率方面实现显著改进。

关键词

引用

@article{arxiv.2504.04633,
  title  = {M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering},
  author = {Yanshu Li and Yi Cao and Hongyang He and Qisen Cheng and Xiang Fu and Xi Xiao and Tianyang Wang and Ruixiang Tang},
  journal= {arXiv preprint arXiv:2504.04633},
  year   = {2025}
}

备注

COLM 2025, 30 pages, 10 figures, 16 tables