多模态任务的模仿上下文学习
机器学习
2025-05-20 v2 人工智能
摘要
近年来,上下文学习(ICL)已成为大型多模态模型(LMM)中一种重要的推理范式,利用少量上下文示例(ICD)提示LMM执行新任务。然而,多模态数据中的协同效应增加了ICL性能对ICD配置的敏感性,从而激发了对更稳定和通用映射函数的需求。从数学上讲,在基于Transformer的模型中,ICD作为“偏移向量”添加到查询令牌的隐藏状态中。受此启发,我们引入了模仿上下文学习(MimIC),以从ICD中学习稳定且可泛化的偏移效应。具体而言,与之前一些基于偏移向量的方法相比,MimIC通过将轻量级可学习模块集成到LMM中,并进行了四项关键改进,更严格地近似了偏移效应:1)在注意力层之后插入偏移向量,2)为每个注意力头分配一个偏移向量,3)使偏移幅度依赖于查询,4)采用逐层对齐损失。在两个LMM(Idefics-9b和Idefics2-8b-base)上跨三个多模态任务(VQAv2、OK-VQA、图像描述)的大量实验表明,MimIC优于现有的基于偏移向量的方法。代码可在https://github.com/Kamichanw/MimIC获取。
引用
@article{arxiv.2504.08851,
title = {Mimic In-Context Learning for Multimodal Tasks},
author = {Yuchu Jiang and Jiale Fu and Chenduo Hao and Xinting Hu and Yingzhe Peng and Xin Geng and Xu Yang},
journal= {arXiv preprint arXiv:2504.08851},
year = {2025}
}
备注
14 pages, 7 figures,CVPR 2025