CoLA:面向多模态下游任务的跨模态低秩适应
计算机视觉与模式识别
2026-04-07 v1 计算与语言
摘要
基础模型已彻底改变人工智能,但将其高效地适应于多模态任务,尤其是在由单模态编码器(如 DINO 和 BERT)构成的双流架构中,仍是一项重大挑战。参数高效微调(PEFT)方法,如低秩适应(LoRA),可实现轻量级适应,但它们在每个模态内独立运作,限制了其捕获跨模态交互的能力。本文中,我们通过跨模态低秩适应(CoLA)向弥合这一差距迈出一步。CoLA 是一种新颖的 PEFT 框架,通过引入一条专用的跨模态适应路径与标准模态内路径并行,从而扩展了 LoRA。这种双路径设计使 CoLA 能够有效将单模态基础模型适应于多模态任务,且模态特定学习与跨模态学习之间互不干扰。我们在一系列视觉-语言(RefCOCO、RefCOCO+、RefCOCOg)和视听(AVE、AVS)基准上评估了 CoLA,其性能始终优于 LoRA,分别实现了约 3% 和 2% 的相对增益,同时保持了参数效率。值得注意的是,CoLA 实现了首个用于视觉定位的多任务 PEFT 框架,弥补了高效多模态适应中的一个关键空白。
引用
@article{arxiv.2604.03314,
title = {CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks},
author = {Wish Suharitdamrong and Tony Alex and Muhammad Awais and Sara Ahmed},
journal= {arXiv preprint arXiv:2604.03314},
year = {2026}
}
备注
14 pages, 6 Figures