LatteGAN:用于多轮文本条件图像编辑的视觉引导语言注意力
计算机视觉与模式识别
2022-06-03 v2
摘要
文本引导的图像编辑任务近年来在视觉与语言领域受到关注。尽管此前多数研究聚焦于单轮编辑,本文的目标是解决更具挑战性的多轮图像编辑(MTIM)任务。该任务的先前模型在给定指令序列和已生成图像后迭代地生成图像,但这种方法存在生成不足以及指令中描述物体的生成质量欠缺的问题,从而降低了整体性能。为克服这些问题,我们提出一种称为视觉引导语言注意力GAN(LatteGAN)的新架构。在此,我们通过引入为生成器提取细粒度文本表示的视觉引导语言注意力(Latte)模块,以及判别真假图像的全局与局部表示的文本条件U-Net判别器架构,解决了先前方法的局限。在两个不同的MTIM数据集CoDraw和i-CLEVR上的大量实验证明了所提模型的state-of-the-art性能。
引用
@article{arxiv.2112.13985,
title = {LatteGAN: Visually Guided Language Attention for Multi-Turn Text-Conditioned Image Manipulation},
author = {Shoya Matsumori and Yuki Abe and Kosuke Shingyouchi and Komei Sugiura and Michita Imai},
journal= {arXiv preprint arXiv:2112.13985},
year = {2022}
}