无目标文本引导的图像编辑
计算机视觉与模式识别
2022-12-02 v2 人工智能
机器学习
摘要
我们解决了无目标文本引导的图像操纵问题,该问题要求根据给定文本指令修改输入参考图像,且在训练期间不观测到真实目标图像。为应对这一挑战性任务,本文提出一种循环操纵GAN(Cyclic-Manipulation GAN, cManiGAN),其能够实现对感兴趣图像区域的编辑位置与编辑方式的确定。具体而言,cManiGAN中的图像编辑器学习识别并完成输入图像,而跨模态解释器与推理器被部署以基于输入指令验证输出图像的语义正确性。前者利用事实/反事实描述学习来鉴证图像语义,后者预测“撤销”指令并为cManiGAN的训练提供像素级监督。借助此种操作循环一致性,我们的cManiGAN可在上述弱监督设定下训练。我们在CLEVR和COCO数据集上进行了大量实验,成功验证了所提方法的有效性与泛化性。项目主页:https://sites.google.com/view/wancyuanfan/projects/cmanigan。
引用
@article{arxiv.2211.14544,
title = {Target-Free Text-guided Image Manipulation},
author = {Wan-Cyuan Fan and Cheng-Fu Yang and Chiao-An Yang and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2211.14544},
year = {2022}
}
备注
AAAI 2023