中文

以数据为中心的视角下的高效多模态学习

计算机视觉与模式识别 2024-07-23 v3

摘要

多模态大语言模型(MLLMs)在通用视觉理解与推理任务中展现了显著能力。然而,其训练和推理过程中巨大的计算成本阻碍了部署,限制了更广泛的研究社区和用户群体的可及性。一个直接的解决方案是利用较小的预训练视觉和语言模型,但这不可避免地会导致性能显著下降。在本文中,我们证明了利用高质量训练数据训练出更小但更优的 MLLM 的可能性。具体而言,我们介绍了 Bunny,这是一系列轻量级 MLLM,具有灵活的视觉和语言骨干网络,旨在通过精选的训练数据实现高效的多模态学习。实验表明,我们的 Bunny-4B/8B 在多个基准测试上优于最先进的大型 MLLM。我们期望这项工作能为社区提供一个干净、灵活的开源工具,以支持进一步的研究与开发。代码、模型和数据可在 https://github.com/BAAI-DCAI/Bunny 获取。

关键词

引用

@article{arxiv.2402.11530,
  title  = {Efficient Multimodal Learning from Data-centric Perspective},
  author = {Muyang He and Yexin Liu and Boya Wu and Jianhao Yuan and Yueze Wang and Tiejun Huang and Bo Zhao},
  journal= {arXiv preprint arXiv:2402.11530},
  year   = {2024}
}