中文

Lumen:释放大规模多模态模型的多功能视觉中心能力

计算机视觉与模式识别 2024-05-29 v2

摘要

大规模多模态模型(LMM)是计算机视觉领域的热门研究课题,并在多个学科领域展现出巨大的潜力。最近的趋势是进一步扩展和增强 LMM 的感知能力。当前方法遵循将视觉任务输出适配到 LMM 主要组件(即语言模型)格式的范式。这种适配使得此类 LMM 的开发更加便捷且只需极少修改,然而它忽视了不同视觉任务的内在特性,并阻碍了感知能力的学习。为解决这一问题,我们提出了一种名为 Lumen 的新型 LMM 架构,即具有多功能视觉中心能力增强的大规模多模态模型。我们将 LMM 感知能力的学习解耦为任务无关和任务特定两个阶段。Lumen 首先促进细粒度的视觉 - 语言概念对齐,这是各种视觉任务的基础能力。因此,任务无关阶段的输出是我们本文中所有任务的共享表示。随后,通过将共享表示灵活路由到轻量级任务解码器来执行任务特定解码,仅需可忽略的训练开销。在一系列视觉中心和 VQA 基准上的综合实验结果表明,我们的 Lumen 模型不仅在一系列视觉中心任务中达到或超越了现有基于 LMM 方法的性能,同时保持了通用的视觉理解和指令遵循能力。代码将在 https://github.com/SxJyJay/Lumen 发布。

关键词

引用

@article{arxiv.2403.07304,
  title  = {Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models},
  author = {Yang Jiao and Shaoxiang Chen and Zequn Jie and Jingjing Chen and Lin Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2403.07304},
  year   = {2024}
}

备注

Technical Report