中文

CLIP-Diffusion-LM: 将扩散模型应用于图像描述生成

计算机视觉与模式识别 2022-10-11 v1 机器学习

摘要

图像描述生成任务已被以往工作广泛研究。然而,聚焦于基于非自回归文本解码器生成描述的研究实验有限。受近期去噪扩散模型在图像合成任务上成功的启发,我们将去噪扩散概率模型应用于图像描述任务中的文本生成。我们展示了我们的 CLIP-Diffusion-LM 能够以显著少于自回归模型的推理步数生成图像描述。在 Flickr8k 数据集上,该模型取得 0.1876 的 BLEU-4 分数。通过在组合的 Flickr8k 与 Flickr30k 数据集上训练,我们的模型取得 0.2470 的 BLEU-4 分数。我们的代码见 https://github.com/xu-shitong/diffusion-image-captioning。

关键词

引用

@article{arxiv.2210.04559,
  title  = {CLIP-Diffusion-LM: Apply Diffusion Model on Image Captioning},
  author = {Shitong Xu},
  journal= {arXiv preprint arXiv:2210.04559},
  year   = {2022}
}