中文

StyleBooth: 基于多模态指令的图像风格编辑

计算机视觉与模式识别 2024-12-17 v2

摘要

给定原始图像,图像编辑旨在生成与提供的指令一致的图像。挑战在于接受多模态输入作为指令,以及缺乏高质量的训练数据,包括关键的源/目标图像对和多模态(文本和图像)指令三元组。在本文中,我们专注于图像风格编辑,并提出了StyleBooth,一种提供图像编辑综合框架和构建高质量风格编辑数据集的可行策略的方法。我们将编码后的文本指令和图像示例作为扩散模型的统一条件,使得能够按照多模态指令编辑原始图像。此外,通过迭代的风格-去风格调整和编辑以及可用性过滤,StyleBooth数据集提供了各种风格类别中内容一致的风格化/普通图像对。为了展示StyleBooth的灵活性,我们在不同任务上进行了实验,例如基于文本的风格编辑、基于示例的风格编辑和组合风格编辑。结果表明,训练数据的质量和多样性显著增强了在编辑任务中保持内容的能力,并提高了生成图像的整体质量。项目页面可在https://ali-vilab.github.io/stylebooth-page/找到。

关键词

引用

@article{arxiv.2404.12154,
  title  = {StyleBooth: Image Style Editing with Multimodal Instruction},
  author = {Zhen Han and Chaojie Mao and Zeyinzi Jiang and Yulin Pan and Jingfeng Zhang},
  journal= {arXiv preprint arXiv:2404.12154},
  year   = {2024}
}