CLIP-Diffusion-LM: 将扩散模型应用于图像描述生成
计算机视觉与模式识别
2022-10-11 v1 机器学习
摘要
图像描述生成任务已被以往工作广泛研究。然而,聚焦于基于非自回归文本解码器生成描述的研究实验有限。受近期去噪扩散模型在图像合成任务上成功的启发,我们将去噪扩散概率模型应用于图像描述任务中的文本生成。我们展示了我们的 CLIP-Diffusion-LM 能够以显著少于自回归模型的推理步数生成图像描述。在 Flickr8k 数据集上,该模型取得 0.1876 的 BLEU-4 分数。通过在组合的 Flickr8k 与 Flickr30k 数据集上训练,我们的模型取得 0.2470 的 BLEU-4 分数。我们的代码见 https://github.com/xu-shitong/diffusion-image-captioning。
引用
@article{arxiv.2210.04559,
title = {CLIP-Diffusion-LM: Apply Diffusion Model on Image Captioning},
author = {Shitong Xu},
journal= {arXiv preprint arXiv:2210.04559},
year = {2022}
}