ILLUME:照亮您的LLM以看到、绘制和自我提升
计算机视觉与模式识别
2024-12-10 v1
摘要
本文介绍了ILLUME,一种统一的多模态大语言模型(MLLM),通过统一的下一个token预测公式无缝集成多模态理解和生成能力于单个大语言模型中。为解决图像-文本对齐通常需要大数据集的瓶颈,我们提出通过设计融合语义信息的视觉标记器和分阶段训练程序来提高数据效率。该方法将数据集规模缩减至仅1500万,比通常需要的四倍以上,同时在现有统一MLLM(如Janus)中实现竞争甚至更好的性能。此外,为促进理解与生成能力之间的协同增强(在先前研究中鲜见),我们引入一种新型自我增强多模态对齐方案。该方案监督MLLM对文本描述与自生成图像一致性的自我评估,促进模型更准确地解释图像,避免因图像生成对齐不一致导致的不切实际和错误预测。基于广泛实验,ILLUME在多模态理解、生成和编辑各类基准测试中脱颖而出,与最先进的统一MLLM及专用模型竞争。
引用
@article{arxiv.2412.06673,
title = {ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance},
author = {Chunwei Wang and Guansong Lu and Junwei Yang and Runhui Huang and Jianhua Han and Lu Hou and Wei Zhang and Hang Xu},
journal= {arXiv preprint arXiv:2412.06673},
year = {2024}
}