中文

面向标记到图像生成的带细粒度序列对齐的对比增强扩散模型

计算机视觉与模式识别 2023-08-03 v1 多媒体 图像与视频处理

摘要

相较于自然图像生成,近期兴起的标记到图像生成因对错误容忍度低以及标记与渲染图像间复杂的序列与上下文关联而带来更大挑战。本文提出一种名为“带细粒度序列对齐的对比增强扩散模型”(FSA-CDM)的新模型,其将对比正/负样本引入扩散模型以提升标记到图像生成性能。在技术上,我们设计细粒度跨模态对齐模块以充分挖掘两模态间序列相似性,学习鲁棒特征表示。为提升泛化能力,提出对比增强扩散模型,通过最大化新颖的对比变分目标显式探索正、负样本,经数学推导该目标为模型优化提供更紧的界。此外,开发上下文感知交叉注意力模块,在去噪过程中捕获标记语言内的上下文信息,从而获得更优的噪声预测结果。在来自不同领域的四个基准数据集上进行了充分实验,结果表明 FSA-CDM 中各组件的有效性,其以约 2%–12% 的 DTW 提升显著超越当前最优性能。代码将于 https://github.com/zgj77/FSACDM 发布。

关键词

引用

@article{arxiv.2308.01147,
  title  = {Contrast-augmented Diffusion Model with Fine-grained Sequence Alignment for Markup-to-Image Generation},
  author = {Guojin Zhong and Jin Yuan and Pan Wang and Kailun Yang and Weili Guan and Zhiyong Li},
  journal= {arXiv preprint arXiv:2308.01147},
  year   = {2023}
}

备注

Accepted to ACM MM 2023. The code will be released at https://github.com/zgj77/FSACDM