中文

用于视觉-语言同步生成的统一离散扩散模型

计算机视觉与模式识别 2022-11-29 v1

摘要

近年来发展的离散扩散模型在文本到图像任务中表现极为出色,在处理多模态信号方面展现出重要潜力。在本工作中,我们利用这些特性,提出了一种统一的多模态生成模型,可使用单一模型执行“模态翻译”与“多模态生成”任务,实现基于文本、基于图像乃至视觉-语言同步生成。具体而言,我们通过提出统一转移矩阵,将多模态信号的离散扩散过程统一起来。此外,我们设计了一个带有融合嵌入层的互注意力模块和统一目标函数,以强调模态间联系,这对多模态生成至关重要。大量实验表明,我们所提方法在各种生成任务中可与最先进的方案相媲美。

关键词

引用

@article{arxiv.2211.14842,
  title  = {Unified Discrete Diffusion for Simultaneous Vision-Language Generation},
  author = {Minghui Hu and Chuanxia Zheng and Heliang Zheng and Tat-Jen Cham and Chaoyue Wang and Zuopeng Yang and Dacheng Tao and Ponnuthurai N. Suganthan},
  journal= {arXiv preprint arXiv:2211.14842},
  year   = {2022}
}