中文

中间融合ViT实现扩散模型中高效的文本-图像对齐

计算机视觉与模式识别 2024-03-26 v1 人工智能

摘要

扩散模型已被广泛用于文本到图像、文本到视频等条件数据跨模态生成任务。然而,最先进的模型仍未能将生成的视觉概念与语言中的高层语义(如物体计数、空间关系等)对齐。我们从多模态数据融合的角度处理这一问题,并研究不同的融合策略如何影响视觉-语言对齐。我们发现,与广泛使用的在预训练图像特征空间中进行条件文本的早期融合相比,一种专门设计的中间融合可以:(i) 提升文本到图像的对齐效果,并改善生成质量;(ii) 通过减少低秩文本到图像的注意力计算,提高训练和推理效率。我们在MS-COCO数据集上使用文本到图像生成任务进行实验。我们在U型ViT骨干网络上,针对两种常见的条件化方法,将我们的中间融合机制与经典的早期融合机制进行了比较。与采用早期融合的强U-ViT基线相比,我们的中间融合模型取得了更高的CLIP分数和更低的FID,同时FLOPs减少20%,训练速度提升50%。

关键词

引用

@article{arxiv.2403.16530,
  title  = {An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models},
  author = {Zizhao Hu and Shaochong Jia and Mohammad Rostami},
  journal= {arXiv preprint arXiv:2403.16530},
  year   = {2024}
}