基于可学习区域的文本驱动图像编辑
计算机视觉与模式识别
2024-04-04 v2 人工智能
机器学习
摘要
语言已成为图像编辑的自然接口。本文提出一种由文本提示驱动的基于区域的图像编辑方法,无需用户提供掩码或草图。具体而言,我们的方法利用已有的预训练文本到图像模型,并引入边界框生成器来识别与文本提示对齐的编辑区域。我们表明这一简单方法可实现与当前图像生成模型兼容的灵活编辑,并能够处理包含多个对象、复杂句子或长篇段落的复杂提示。我们开展了广泛的用户研究,将我们的方法与最先进方法进行比较。实验证明了我们的方法在依据所给语言描述以高保真度与真实感操纵图像方面的竞争性能。我们的项目网页位于:https://yuanze-lin.me/LearnableRegions_page。
引用
@article{arxiv.2311.16432,
title = {Text-Driven Image Editing via Learnable Regions},
author = {Yuanze Lin and Yi-Wen Chen and Yi-Hsuan Tsai and Lu Jiang and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2311.16432},
year = {2024}
}
备注
Accepted to CVPR 2024 Project webpage: https://yuanze-lin.me/LearnableRegions_page