中文

InstructAny2Pix:基于多模态指令跟随的灵活视觉编辑

计算机视觉与模式识别 2024-10-18 v4

摘要

为生成和编辑视觉图像提供细粒度控制的能力对计算机视觉及其应用具有深远影响。以往的工作探索了在两个方向上扩展可控性:基于文本提示的指令微调和多模态条件化。然而,这些工作对用于表达可控性的模态输入的数量和/或类型做出了一个或多个不自然的假设。我们提出了 InstructAny2Pix,一个灵活的多模态指令跟随系统,使用户能够使用涉及音频、图像和文本的指令来编辑输入图像。InstructAny2Pix 由三个构建模块组成,以实现此能力:一个多模态编码器,将图像和音频等不同模态编码到统一的潜在空间;一个扩散模型,学习将该潜在空间中的表示解码为图像;以及一个多模态大语言模型 (LLM),能够理解涉及多个图像和音频片段的指令,并生成所需输出的条件嵌入,供扩散解码器使用。此外,为了提高训练效率和生成质量,我们加入了一个额外的细化先验模块,以增强大语言模型输出的视觉质量。这些设计对我们系统的性能至关重要。我们证明,我们的系统可以执行一系列新颖的指令引导编辑任务。代码可在 https://github.com/jacklishufan/InstructAny2Pix.git 获取。

关键词

引用

@article{arxiv.2312.06738,
  title  = {InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following},
  author = {Shufan Li and Harkanwar Singh and Aditya Grover},
  journal= {arXiv preprint arXiv:2312.06738},
  year   = {2024}
}

备注

25 pages, 19 figures