中文

HIFICL:多模态任务的高保真原语学习

计算机视觉与模式识别 2026-03-30 v4

摘要

原语学习 (In-Context Learning, ICL) 是大型多模态模型 (LMM) 的重要范式,通过少量原语演示 (ICDs) 适应新任务。然而,其性能对演示配置敏感且计算成本高昂。从数学上讲,这些演示的影响可分解为标准注意力输出与上下文值的动态混合。现有近似方法通过学习一个"平移向量"来简化此过程。受精确分解的启发,我们提出High-Fidelity In-Context Learning (HIFICL),以更忠实地建模ICL机制。HIFICL包含三个关键组件:1) 一组"虚拟键值对"作为可学习的上下文,2) 用于稳定和正则化训练的低秩分解,3) 一个简单的端到端训练目标。从另一个角度看,这一机制构成一种形式的上下文感知参数高效微调 (PEFT)。大量实验表明,HIFICL在多个多模态基准测试上 consistently 优于现有近似方法。代码可在 https://github.com/bbbandari/HiFICL 获取。

关键词

引用

@article{arxiv.2603.12760,
  title  = {HIFICL: High-Fidelity In-Context Learning for Multimodal Tasks},
  author = {Xiaoyu Li and Yuhang Liu and Xuanshuo Kang and Zheng Luo and Fangqi Lou and Xiaohua Wu and Zihan Xiong},
  journal= {arXiv preprint arXiv:2603.12760},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Code available at https://github.com/bbbandari/HiFICL