LaDiC:扩散模型在图像到文本生成中是否真的逊于自回归模型?
人工智能
2024-04-17 v1 计算与语言
计算机视觉与模式识别
摘要
扩散模型在文本到图像生成方面表现出惊人的能力,但在图像到文本生成(具体为图像描述生成)方面却落后于自回归(AR)模型,这对其在此类任务中的适用性提出了质疑。本文重新审视扩散模型,突出其进行整体上下文建模和并行解码的能力。凭借这些优势,扩散模型可以缓解 AR 方法固有的局限性,包括其慢的推理速度、错误传播以及单向限制。进一步地,我们识别出扩散模型先前的不佳表现源于缺乏有效的潜在空间用于图像-文本对齐,以及连续扩散过程与离散文本数据之间的差异。作为响应,我们我们引入一种新型架构 LaDiC,该架构利用分割后的 BERT 创建用于描述的专用潜在空间,并集成一个规则化模块来管理不同文本长度。我们的框架还包括一种用于语义图像到文本转换的扩散器以及一种 Back&Refine 技术以增强推理期间的 token 互动性。LaDiC 在 MS COCO 数据集上实现了扩散方法的最新性能,BLEU@4 为 38.2,CIDEr 为 126.2,无需预训练或附加模块即可展现出卓越的性能。这表明其在图像到文本生成中与 AR 模型具有强大的竞争力,揭示了扩散模型在此类任务中潜在的未被充分挖掘的能力。
引用
@article{arxiv.2404.10763,
title = {LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?},
author = {Yuchi Wang and Shuhuai Ren and Rundong Gao and Linli Yao and Qingyan Guo and Kaikai An and Jianhong Bai and Xu Sun},
journal= {arXiv preprint arXiv:2404.10763},
year = {2024}
}