InternLM-XComposer2:掌握视觉-语言大模型中的自由形式图文组合与理解
计算机视觉与模式识别
2024-01-30 v1 计算与语言
摘要
我们介绍了InternLM-XComposer2,一种前沿的视觉-语言模型,在自由形式的图文组合与理解方面表现出色。该模型超越了传统的视觉-语言理解,能够根据大纲、详细的文本规范和参考图像等多种输入,巧妙地生成交错的图文内容,实现高度可定制的内容创作。InternLM-XComposer2提出了一种部分LoRA(PLoRA)方法,该方法仅对图像令牌应用额外的LoRA参数,以保持预训练语言知识的完整性,在精确的视觉理解与富有文学才华的文本组合之间取得平衡。实验结果表明,基于InternLM2-7B的InternLM-XComposer2在生成高质量长文本多模态内容方面具有优越性,并在各种基准测试中展现出卓越的视觉-语言理解性能,不仅显著优于现有的多模态模型,而且在某些评估中达到甚至超越了GPT-4V和Gemini Pro。这突显了其在多模态理解领域的卓越能力。InternLM-XComposer2模型系列(7B参数)已在https://github.com/InternLM/InternLM-XComposer公开提供。
引用
@article{arxiv.2401.16420,
title = {InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model},
author = {Xiaoyi Dong and Pan Zhang and Yuhang Zang and Yuhang Cao and Bin Wang and Linke Ouyang and Xilin Wei and Songyang Zhang and Haodong Duan and Maosong Cao and Wenwei Zhang and Yining Li and Hang Yan and Yang Gao and Xinyue Zhang and Wei Li and Jingwen Li and Kai Chen and Conghui He and Xingcheng Zhang and Yu Qiao and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2401.16420},
year = {2024}
}
备注
Code and models are available at https://github.com/InternLM/InternLM-XComposer