DE-Net:动态文本引导的图像编辑对抗网络
计算机视觉与模式识别
2022-08-23 v2 多媒体
摘要
文本引导的图像编辑模型已展现出显著成果。然而,仍存在两个问题。第一,它们针对各种编辑需求(例如颜色改变、纹理改变、内容添加与移除)采用固定的操作模块,导致过度编辑或编辑不足。第二,它们未能清晰区分文本所需部分与文本无关部分,导致编辑不准确。为解决这些局限,我们提出:(i) 一个动态编辑块(DEBlock),针对不同编辑需求动态组合不同编辑模块;(ii) 一个组合预测器(Comp-Pred),根据对目标文本和源图像的推断为 DEBlock 预测组合权重;(iii) 一个动态文本自适应卷积块(DCBlock),通过查询源图像特征来区分文本所需部分与文本无关部分。大量实验表明,我们的 DE-Net 取得了优异性能,并能更正确、准确地操控源图像。代码见 \url{https://github.com/tobran/DE-Net}。
引用
@article{arxiv.2206.01160,
title = {DE-Net: Dynamic Text-guided Image Editing Adversarial Networks},
author = {Ming Tao and Bing-Kun Bao and Hao Tang and Fei Wu and Longhui Wei and Qi Tian},
journal= {arXiv preprint arXiv:2206.01160},
year = {2022}
}