Open-Edit:基于开放词汇指令的开放域图像编辑
计算机视觉与模式识别
2021-04-22 v2
摘要
我们提出了一种名为 Open-Edit 的新算法,这是首个针对基于开放词汇指令的开放域图像操控的尝试。考虑到图像域的巨大差异以及训练监督的缺乏,这是一项具有挑战性的任务。我们的方法利用了在通用图像-描述数据集上预训练的统一视觉-语义嵌入空间,并通过在图像特征图上施加文本引导的向量算术来操控所嵌入的视觉特征。随后,一个保持结构的图像解码器从被操控的特征图生成被操控的图像。我们进一步提出了一种带循环一致性约束的即时样本特定优化方法,以正则化被操控的图像并迫使它们保留源图像的细节。我们的方法在针对开放域图像各种场景操控开放词汇的颜色、纹理和高级属性方面展示了有前景的结果。
引用
@article{arxiv.2008.01576,
title = {Open-Edit: Open-Domain Image Manipulation with Open-Vocabulary Instructions},
author = {Xihui Liu and Zhe Lin and Jianming Zhang and Handong Zhao and Quan Tran and Xiaogang Wang and Hongsheng Li},
journal= {arXiv preprint arXiv:2008.01576},
year = {2021}
}
备注
ECCV 2020. Introduction video at https://youtu.be/8E3bwvjCHYE and code at https://github.com/xh-liu/Open-Edit