Kosmos-G:利用多模态大语言模型在上下文中生成图像
计算机视觉与模式识别
2024-04-29 v3 计算与语言
摘要
近期在主体驱动图像生成方面的进展已取得显著成果。然而,当前方法在多样化应用场景中仍显不足,因为它们需要测试时调优且无法接受交错的多图像与文本输入。这些局限使其远未达成“图像作为图像生成中的外语”这一终极目标。本文提出 Kosmos-G,一种利用多模态大语言模型(MLLM)先进多模态感知能力来应对上述挑战的模型。我们的方法以文本模态为锚点,将 MLLM 的输出空间与 CLIP 对齐,并在精选数据上执行组合指令微调。Kosmos-G 展现出以交错多图像与文本输入进行零样本主体驱动生成的卓越能力。值得注意的是,分数蒸馏指令微调无需修改图像解码器。这使得 CLIP 的无缝替换以及与从细粒度控制到个性化图像解码器变体等众多 U-Net 技术的轻松集成成为可能。我们视 Kosmos-G 为迈向“图像作为图像生成中的外语”目标的一次初步尝试。代码可在 https://aka.ms/Kosmos-G 获取。
引用
@article{arxiv.2310.02992,
title = {Kosmos-G: Generating Images in Context with Multimodal Large Language Models},
author = {Xichen Pan and Li Dong and Shaohan Huang and Zhiliang Peng and Wenhu Chen and Furu Wei},
journal= {arXiv preprint arXiv:2310.02992},
year = {2024}
}
备注
Code: https://aka.ms/Kosmos-G Project Page: https://xichenpan.github.io/kosmosg