Mini-InternVL:5% 参数与 90% 性能的灵活迁移口袋型多模态模型
计算机视觉与模式识别
2024-11-08 v3
摘要
多模态大语言模型 (MLLM) 在广泛领域的视觉语言任务上已展示出惊人的性能。然而,大规模模型及其高计算成本对在消费级 GPU 或边缘设备上训练和部署 MLLM 构成了重大挑战,从而阻碍了其广泛应用。在本工作中,我们引入了 Mini-InternVL,一个参数范围为 1B 至 4B 的 MLLM 系列,在仅使用 5% 参数的情况下即可实现 90% 的性能。这种效率与效果的显著提升使我们的模型更易于在各种实际场景中应用。为进一步促进我们模型的采用,我们开发了 Mini-InternVL 的统一适应框架,使我们的模型在下游任务中(包括自动驾驶、医学影像和遥感)能够实现 transfer and outperform 专用模型。我们认为本研究为推动高效且有效的 MLLM 开发提供了宝贵的见解和资源。代码已公开于 https://github.com/OpenGVLab/InternVL。
引用
@article{arxiv.2410.16261,
title = {Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance},
author = {Zhangwei Gao and Zhe Chen and Erfei Cui and Yiming Ren and Weiyun Wang and Jinguo Zhu and Hao Tian and Shenglong Ye and Junjun He and Xizhou Zhu and Lewei Lu and Tong Lu and Yu Qiao and Jifeng Dai and Wenhai Wang},
journal= {arXiv preprint arXiv:2410.16261},
year = {2024}
}
备注
Technical report