中文

DreamLLM:多模态理解与生成协同

计算机视觉与模式识别 2024-03-19 v2 计算与语言 机器学习

摘要

本文提出 DreamLLM,这是一个学习框架,首次实现了具备常被忽视的多模态理解与生成之间协同能力的通用多模态大语言模型(Multimodal Large Language Models, MLLMs)。DreamLLM 基于两个基本原则运作。第一个原则侧重于通过在原始多模态空间中直接采样来对语言和图像后验进行生成建模。该方法规避了像 CLIP 这类外部特征提取器的局限性和固有信息损失,从而获得更透彻的多模态理解。第二,DreamLLM 促进原始交错文档的生成,对文本和图像内容以及非结构化布局进行建模。这使得 DreamLLM 能够有效学习所有条件、边缘和联合多模态分布。因此,DreamLLM 是首个能够生成自由形式交错内容的 MLLM。综合实验凸显了 DreamLLM 作为零样本多模态通才的优越性能,得益于增强的学习协同。项目页面:https://dreamllm.github.io。

关键词

引用

@article{arxiv.2309.11499,
  title  = {DreamLLM: Synergistic Multimodal Comprehension and Creation},
  author = {Runpei Dong and Chunrui Han and Yuang Peng and Zekun Qi and Zheng Ge and Jinrong Yang and Liang Zhao and Jianjian Sun and Hongyu Zhou and Haoran Wei and Xiangwen Kong and Xiangyu Zhang and Kaisheng Ma and Li Yi},
  journal= {arXiv preprint arXiv:2309.11499},
  year   = {2024}
}

备注

ICLR 2024 (Spotlight)