赋能视觉创造力:面向图像编辑推荐的视觉语言助手
计算机视觉与模式识别
2024-06-04 v1
摘要
基于文本的图像生成和编辑的进步彻底改变了内容创作,使用户能够从富有想象力的文本提示中创建令人印象深刻的内容。然而,现有方法并不适用于在典型场景中用户仅以模糊或抽象的目的开始编辑时经常遇到的过于简化的提示。这些场景需要用户付出大量的构思努力,以弥合这种模糊起点与描绘期望结果所需的详细创意想法之间的差距。在本文中,我们引入了图像编辑推荐(IER)任务。该任务旨在从输入图像和代表用户未明确指定编辑目的的简单提示中自动生成多样化的创意编辑指令。为此,我们提出了创造力-视觉语言助手(Creativity-VLA),一种专门为编辑指令生成设计的多模态框架。我们在专门为IER策划的编辑指令数据集上训练Creativity-VLA。我们进一步用新颖的“token-for-localization”机制增强我们的模型,使其能够支持全局和局部编辑操作。我们的实验结果表明,\ours{}在建议指令方面的有效性,这些指令不仅包含引人入胜的创意元素,而且与输入图像和用户的初始提示保持高度相关性。
引用
@article{arxiv.2406.00121,
title = {Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations},
author = {Tiancheng Shen and Jun Hao Liew and Long Mai and Lu Qi and Jiashi Feng and Jiaya Jia},
journal= {arXiv preprint arXiv:2406.00121},
year = {2024}
}