中文

DiffCap:在图像字幕上探索连续扩散

计算机视觉与模式识别 2023-05-23 v1 人工智能

摘要

当前的图像字幕工作通常聚焦于以自回归方式生成描述。然而,关注以非自回归方式生成描述的工作有限,后者带来更多的解码多样性。受扩散模型在生成自然外观图像上成功的启发,我们提出一种名为 DiffCap 的新方法,将连续扩散应用于图像字幕。与输出为固定尺寸且连续的图片生成不同,图像描述长度随离散 token 变化。我们的方法以自然方式转换离散 token 并对其应用连续扩散,成功融合提取的图像特征以进行扩散字幕生成。我们在 COCO 数据集上的实验表明,我们的方法使用更简单的结构即可达到与先前非自回归工作相当的结果。除质量外,DiffCap 的一个引人注目特性是其生成过程中的高多样性,这是许多自回归模型所缺失的。我们相信这种在扩散语言生成中融合多模态特征的方法,将因其简洁性与解码灵活性而启发更多关于多模态语言生成任务的研究。

关键词

引用

@article{arxiv.2305.12144,
  title  = {DiffCap: Exploring Continuous Diffusion on Image Captioning},
  author = {Yufeng He and Zefan Cai and Xu Gan and Baobao Chang},
  journal= {arXiv preprint arXiv:2305.12144},
  year   = {2023}
}