InternLM-XComposer:面向高级图文理解与生成的视觉语言大模型
计算机视觉与模式识别
2023-12-15 v5
摘要
我们提出InternLM-XComposer,一种支持高级图像-文本理解与生成的视觉语言大模型。我们模型的创新性由三个引人注目的特性凸显:1)交错图文生成:InternLM-XComposer可轻松生成无缝融合图像、连贯且具上下文的文章,提供更引人入胜和沉浸式的阅读体验。只需提供写作指令,我们的系统即生成相应稿件。它能智能识别文本中图像可增强内容的区域,并自动插入最合适的视觉候选。2)富含多语言知识的理解:图像-文本理解通过在精心设计的策略下对广泛的多模态多语言数据库训练而增强,从而实现对视觉内容的深度理解。3)最先进性能:我们的模型在视觉语言基础模型的多个主流基准上持续取得最先进结果,包括MME Benchmark、MMBench、MMBench-CN、Seed-Bench、CCBenchmark(中国文化基准)、QBench和Tiny LVLM。由于缺乏评估图文生成的既定量化指标,我们设计了由人工与GPT4-Vision(GPT4-V)共同参与的鲁棒评估流程以确保可靠性。值得注意的是,我们的InternLM-XComposer在图文生成分数上相较包括GPT4-V和GPT3.5在内的公开方案具竞争力。总体而言,InternLM-XComposer无缝融合高级图文理解与生成,革新了视觉语言交互并提供了新见解与机遇。InternLM-XComposer模型系列公开于 https://github.com/InternLM/InternLM-XComposer。
引用
@article{arxiv.2309.15112,
title = {InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition},
author = {Pan Zhang and Xiaoyi Dong and Bin Wang and Yuhang Cao and Chao Xu and Linke Ouyang and Zhiyuan Zhao and Haodong Duan and Songyang Zhang and Shuangrui Ding and Wenwei Zhang and Hang Yan and Xinyue Zhang and Wei Li and Jingwen Li and Kai Chen and Conghui He and Xingcheng Zhang and Yu Qiao and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2309.15112},
year = {2023}
}
备注
Code and models are available at https://github.com/InternLM/InternLM-XComposer