中文

SSD:迈向文本到图像生成中更优的文本-图像一致性度量

计算机视觉与模式识别 2022-12-06 v3

摘要

从给定文本生成一致且高质量的图像对于视觉-语言理解至关重要。尽管在生成高质量图像方面已取得令人瞩目的成果,但在现有基于 GAN 的方法中,文本-图像一致性仍是一个主要问题。特别是,最流行的度量指标 RR-precision 可能无法准确反映文本-图像一致性,常常导致生成图像中出现严重误导的语义。尽管其意义重大,如何设计一个更好的文本-图像一致性度量指标在社区中仍出人意料地未被充分探索。本文中,我们向前迈进一步,提出了一种新颖的基于 CLIP 的度量指标,称为语义相似性距离(Semantic Similarity Distance,SSDSSD),该指标既有基于分布视角的理论基础,又在基准数据集上得到了实证验证。受益于所提出的度量指标,我们进一步设计了并行深度融合生成对抗网络(PDF-GAN),旨在通过融合不同粒度的语义信息并捕获精确语义来提高文本-图像一致性。配备了硬负句构造器和语义投影这两个新颖的即插即用组件,所提出的 PDF-GAN 能够缓解不一致的语义并弥合文本-图像语义鸿沟。一系列实验表明,与当前最先进的方法相比,我们的 PDF-GAN 能够在 CUB 和 COCO 数据集上显著提升文本-图像一致性,同时保持可观的图像质量。

关键词

引用

@article{arxiv.2210.15235,
  title  = {SSD: Towards Better Text-Image Consistency Metric in Text-to-Image Generation},
  author = {Zhaorui Tan and Xi Yang and Zihan Ye and Qiufeng Wang and Yuyao Yan and Anh Nguyen and Kaizhu Huang},
  journal= {arXiv preprint arXiv:2210.15235},
  year   = {2022}
}