基于最小文本输入的用户友好型图像编辑:利用描述生成与注入技术
计算机视觉与模式识别
2023-06-06 v1
摘要
近期扩散模型中文本驱动的图像编辑取得了显著成功。然而,现有方法假设用户的描述充分锚定了源图像中的上下文,如物体、背景、风格及其关系。该假设不适用于真实应用,因为用户必须手动设计文本提示以为不同图像寻找最优描述。从用户角度看,提示工程是劳动密集型过程,用户更倾向于提供用于编辑的目标词而非完整句子。为解决此问题,我们首先通过将提示按语义细节程度分为三类,展示了源图像详细文本描述的重要性。随后,我们提出结合提示生成框架的简洁而有效的方法,从而使提示工程过程更加用户友好。大量定性与定量实验证明了提示在文本驱动图像编辑中的重要性,且我们的方法与真实提示(groud-truth prompts)相当。
引用
@article{arxiv.2306.02717,
title = {User-friendly Image Editing with Minimal Text Input: Leveraging Captioning and Injection Techniques},
author = {Sunwoo Kim and Wooseok Jang and Hyunsu Kim and Junho Kim and Yunjey Choi and Seungryong Kim and Gayeong Lee},
journal= {arXiv preprint arXiv:2306.02717},
year = {2023}
}