中文

MAIL++:面向视觉-语言模型的多模态双向智能体层

计算机视觉与模式识别 2026-05-26 v1

摘要

适配大型视觉-语言模型(VLM)如CLIP到下游任务仍然具有挑战性,因为完整微调在低数据条件下计算昂贵且容易过拟合。参数高效微调(PEFT)通过轻量级提示或适配器模块缓解了这些问题,跨模态耦合尤其有效,通过强化视觉和语言之间的相互作用。然而,现有耦合机制主要依赖外部辅助模块,导致间接、粗粒度的相互作用在结构上与原始VLM脱节,从而限制了表示的表达性。本文提出一种多模态交互式智能体层(MAIL),这是一种将跨模态耦合嵌入VLM内在计算模块中的PEFT范式。MAIL冻结主干网络,在核心模块(如LayerNorm)后插入轻量级智能体层,以近似完整微调所产生的参数更新。为在该层级上对视觉和文本流进行耦合,我们引入一种基于瓶颈的文本到图像桥接,联合优化配对的智能体层,协调对应计算模块的适应。我们进一步提出MAIL++,通过一种元智能体层、元文本桥接和元图像桥接实现双向跨模态交换。在推理时,所有智能体层被重参数化到冻结的主干网络中,保留原始的计算效率。广泛的实验表明,MAIL和MAIL++在few-shot图像分类和few-shot通用跨域检索方面 consistently优于最新的PEFT方法。

关键词

引用

@article{arxiv.2605.25479,
  title  = {MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models},
  author = {Kaixiang Chen and Pengfei Fang and Hui Xue},
  journal= {arXiv preprint arXiv:2605.25479},
  year   = {2026}
}