中文

DAFT-GAN:基于双仿射变换的生成对抗网络用于文本引导图像填充

计算机视觉与模式识别 2024-08-12 v1

摘要

近年来,文本引导图像填充研究取得了显著进展,但由于确保图像与文本对齐以及维持受损区域与未受损区域分布一致性等约束条件,该任务仍面临挑战。为此,本文提出一种双仿射变换生成对抗网络 (DAFT-GAN) 以维持文本引导填充的语义一致性。DAFT-GAN 集成了两个仿射变换网络,逐步组合文本和图像特征于每个解码块。此外,我们通过独立编码掩码图像的受损区域和未受损区域来最小化未受损特征的信息泄露,从而实现精细的图像生成。我们的方法在质量和定量评估方面均优于现有的 GAN-based 模型,并使用三个基准数据集 (MS-COCO、CUB 和 Oxford) 进行文本引导图像填充测试。

关键词

引用

@article{arxiv.2408.04962,
  title  = {DAFT-GAN: Dual Affine Transformation Generative Adversarial Network for Text-Guided Image Inpainting},
  author = {Jihoon Lee and Yunhong Min and Hwidong Kim and Sangtae Ahn},
  journal= {arXiv preprint arXiv:2408.04962},
  year   = {2024}
}

备注

ACM MM'2024. 9 pages, 3 tables, 9 figures