用于图像字幕的语义条件扩散网络
计算机视觉与模式识别
2022-12-07 v1 计算与语言
多媒体
摘要
近期文本到图像生成的进展见证了扩散模型作为强大生成模型的兴起。然而,利用此类潜变量模型捕捉离散词之间的依赖关系,同时在图像字幕中追求复杂的视觉-语言对齐并非易事。本文打破了基于Transformer编码器-解码器学习的根深蒂固惯例,提出了一种专为图像字幕设计的基于扩散模型的新范式,即语义条件扩散网络(SCD-Net)。技术上,对于每个输入图像,我们首先通过跨模态检索模型搜索语义相关句子以传达全面语义信息。丰富语义进一步被视为语义先验来触发扩散Transformer的学习,其在扩散过程中生成输出句子。在SCD-Net中,多个扩散Transformer结构以级联方式堆叠,逐步增强输出句子以获得更好的视觉-语言对齐和语言连贯性。此外,为稳定扩散过程,设计了一种新的自我批判序列训练策略,以标准自回归Transformer模型的知识引导SCD-Net的学习。在COCO数据集上的大量实验证明了在具有挑战性的图像字幕任务中使用扩散模型的可行潜力。源代码见\url{https://github.com/YehLi/xmodaler/tree/master/configs/image_caption/scdnet}。
引用
@article{arxiv.2212.03099,
title = {Semantic-Conditional Diffusion Networks for Image Captioning},
author = {Jianjie Luo and Yehao Li and Yingwei Pan and Ting Yao and Jianlin Feng and Hongyang Chao and Tao Mei},
journal= {arXiv preprint arXiv:2212.03099},
year = {2022}
}
备注
Source code is available at \url{https://github.com/YehLi/xmodaler/tree/master/configs/image_caption/scdnet}