用于交互式图像编辑的序列注意力 GAN
计算机视觉与模式识别
2020-08-07 v4 人工智能
机器学习
摘要
大多数现有的文本到图像合成任务是基于图像预定义文本描述的静态单轮生成。为探索更实用和交互的真实应用,我们引入一项新任务——交互式图像编辑,其中用户可通过多轮文本指令实时引导智能体编辑图像。在每轮会话中,智能体将用户给出的自然语言描述作为输入,并依据用户描述修改前一轮生成的图像为新设计。这一序列且交互的图像生成任务的主要挑战有两方面:1) 生成图像与所给文本描述间的上下文一致性;2) 逐步的区域级修改以维持每轮会话中生成图像序列的视觉一致性。为应对这些挑战,我们提出一种新颖的序列注意力生成对抗网络(SeqAttnGAN),其应用神经状态跟踪器编码序列每轮中的前序图像与文本描述,并使用 GAN 框架生成与前述图像一致且与描述连贯的修改后图像。为实现更好的区域特定细化,我们还将序列注意力机制引入模型。为在新任务上基准测试,我们引入两个新数据集 Zap-Seq 与 DeepFashion-Seq,其包含时尚领域中带图像-描述序列的多轮会话。在两者上的实验表明,所提 SeqAttnGAN 模型在所有评估指标(包括视觉质量、图像序列连贯性与文本-图像一致性)上均优于交互式图像编辑任务的最先进方法。
引用
@article{arxiv.1812.08352,
title = {Sequential Attention GAN for Interactive Image Editing},
author = {Yu Cheng and Zhe Gan and Yitong Li and Jingjing Liu and Jianfeng Gao},
journal= {arXiv preprint arXiv:1812.08352},
year = {2020}
}
备注
ACM MM 2020