基于跨模态情境学习的多模态生成
广义相对论与量子宇宙学
2024-11-22 v2
摘要
本文研究了从复杂多模态提示序列生成新图像的问题。虽然现有方法在文本到图像生成方面取得了令人鼓舞的成果,但它们往往难以捕捉长提示中细粒度细节,并维持提示序列中的上下文连贯性。此外,它们常常在包含多个物体的提示序列上生成图像时存在对齐问题。为此,我们提出了一种基于跨模态情境学习的多模态生成方法(MGCC),通过利用大型语言模型(LLM)和扩散模型的综合能力,从复杂的多模态提示序列中生成新图像。我们的MGCC包含一个新的跨模态细化模块,用于在LLM嵌入空间中显式学习文本和图像之间的跨模态依赖,以及一个上下文对象定位模块,用于针对包含多个物体的场景生成物体边界框。我们的MGCC展示了多样化的多模态能力,如新图像生成、多模态对话促进、文本生成等。在两个基准数据集上的实验评估表明,我们方法的有效性。在包含多模态输入的Visual Story Generation(VIST)数据集上,我们的MGCC获得了0.652的CLIP相似度得分,与SOTA GILL的0.641相比。同样,在包含长对话序列的Visual Dialogue Context(VisDial)上,我们的MGCC获得了令人印象深刻的0.660的CLIP得分,显著优于现有SOTA方法的0.645。代码:https://github.com/VIROBO-15/MGCC
引用
@article{arxiv.2405.18303,
title = {Nonlinear effect of absorption on the ringdown of a spinning black hole},
author = {Taillte May and Sizheng Ma and Justin L. Ripley and William E. East},
journal= {arXiv preprint arXiv:2405.18303},
year = {2024}
}
备注
29 pages, 16 figures