中文

MultiWay-Adapter:面向可扩展图文检索的大规模多模态模型适配框架

计算机视觉与模式识别 2024-02-07 v3 人工智能 机器学习 多媒体

摘要

随着多模态大语言模型(Multimodal Large Language Models, MLLMs)规模的增长,由于高计算和内存需求,将其适配到专门任务变得越来越具挑战性。事实上,传统微调方法成本高昂,因为需要进行大量的任务特定训练。尽管存在旨在降低这些成本的高效适配方法,但在实践中它们受限于浅层的模态间对齐,严重损害了模型有效性。为应对这些计算挑战并改善模态间对齐,我们引入了MultiWay-Adapter (MWA),一种具有“对齐增强器”的新颖框架。该增强器深化模态间对齐,以最小的调优代价实现高可迁移性。我们的实验表明,与先前的有效调优方法不同,MWA在将训练时间减少多达57%的同时保持了模型有效性。MWA还轻量,对于BEiT-3 Large等最先进的基础模型,仅增加2-3%的模型规模(按参数计)。这些结果表明,MWA为MLLM提供了一种高效且有效的适配方法,显著拓宽了它们的适用性。

关键词

引用

@article{arxiv.2309.01516,
  title  = {MultiWay-Adapater: Adapting large-scale multi-modal models for scalable image-text retrieval},
  author = {Zijun Long and George Killick and Richard McCreadie and Gerardo Aragon Camarasa},
  journal= {arXiv preprint arXiv:2309.01516},
  year   = {2024}
}