以数据为中心的视角下的高效多模态学习
计算机视觉与模式识别
2024-07-23 v3
摘要
多模态大语言模型(MLLMs)在通用视觉理解与推理任务中展现了显著能力。然而,其训练和推理过程中巨大的计算成本阻碍了部署,限制了更广泛的研究社区和用户群体的可及性。一个直接的解决方案是利用较小的预训练视觉和语言模型,但这不可避免地会导致性能显著下降。在本文中,我们证明了利用高质量训练数据训练出更小但更优的 MLLM 的可能性。具体而言,我们介绍了 Bunny,这是一系列轻量级 MLLM,具有灵活的视觉和语言骨干网络,旨在通过精选的训练数据实现高效的多模态学习。实验表明,我们的 Bunny-4B/8B 在多个基准测试上优于最先进的大型 MLLM。我们期望这项工作能为社区提供一个干净、灵活的开源工具,以支持进一步的研究与开发。代码、模型和数据可在 https://github.com/BAAI-DCAI/Bunny 获取。
引用
@article{arxiv.2402.11530,
title = {Efficient Multimodal Learning from Data-centric Perspective},
author = {Muyang He and Yexin Liu and Boya Wu and Jianhao Yuan and Yueze Wang and Tiejun Huang and Bo Zhao},
journal= {arXiv preprint arXiv:2402.11530},
year = {2024}
}