中文

面向视觉-语言指令微调的簇条件 LoRA 专家混合

计算机视觉与模式识别 2024-07-08 v5

摘要

大型视觉-语言模型(LVLMs)的指令微调彻底改变了多功能模型的发展,使其在广泛的下游视觉-语言任务中具备零样本泛化能力。然而,不同来源和格式的训练任务的多样性会导致不可避免的冲突,即不同任务竞争同一组模型参数,从而导致次优的指令遵循能力。为了解决这一问题,我们提出了簇条件 LoRA 专家混合,一种新颖的混合专家架构,旨在基于指令簇激活任务定制化的模型参数。进一步引入了一个独立的通用专家,以提高 MoCLE 对新指令的泛化能力。在 InstructBLIP 和 LLaVA 上的大量实验证明了 MoCLE 的有效性。

关键词

引用

@article{arxiv.2312.12379,
  title  = {Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning},
  author = {Yunhao Gou and Zhili Liu and Kai Chen and Lanqing Hong and Hang Xu and Aoxue Li and Dit-Yan Yeung and James T. Kwok and Yu Zhang},
  journal= {arXiv preprint arXiv:2312.12379},
  year   = {2024}
}

备注

Project website: https://gyhdog99.github.io/projects/mocle/