ClickDiffusion:利用大语言模型进行交互式精确图像编辑
计算机视觉与模式识别
2024-04-09 v1 人工智能
摘要
近年来,研究人员提出了使用自然语言指令生成和操作图像的强大系统。然而,仅凭文本很难精确指定许多常见类别的图像变换。例如,用户可能希望更改一张包含几只相似狗的图像中某只特定狗的位置和品种。仅使用自然语言完成此任务相当困难,需要用户编写一个繁琐复杂的提示,既要区分目标狗,又要描述目标位置。我们提出了ClickDiffusion,一个精确图像操作和生成的系统,它将自然语言指令与用户通过直接操作界面提供的视觉反馈相结合。我们证明,通过将图像和多模态指令序列化为文本表示,可以利用大语言模型执行图像布局和外观的精确变换。代码可在https://github.com/poloclub/ClickDiffusion获取。
引用
@article{arxiv.2404.04376,
title = {ClickDiffusion: Harnessing LLMs for Interactive Precise Image Editing},
author = {Alec Helbling and Seongmin Lee and Polo Chau},
journal= {arXiv preprint arXiv:2404.04376},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2402.07925