中文

SemanticDraw:基于图像扩散模型的实时交互式内容生成

计算机视觉与模式识别 2025-06-03 v4

摘要

我们引入了 SemanticDraw,一种交互式内容生成的新范式,其中根据给定的多个手绘区域生成高质量图像,每个区域编码了规定的语义含义,且近乎实时。为了最大化内容创作者的生产力并充分实现他们的艺术想象,他们的工具既需要快速的交互界面,又需要细粒度的区域控制。尽管最近的扩散模型具有惊人的生成质量,我们发现现有的区域可控性方法非常慢(生成 512×512512 \times 512 图像需要 52 秒),并且与 LCM 等加速方法不兼容,阻碍了它们在交互式内容生成中的巨大潜力。基于这一观察,我们分两步构建了交互式内容生成的解决方案:(1)我们建立了扩散模型的基于区域控制与加速技术之间的兼容性,在推理步骤减少 ×10\times 10 的情况下保持了多提示图像生成的高保真度;(2)我们通过新的多提示流批处理流水线提高了生成吞吐量,从而在单个 RTX 2080 Ti GPU 上实现了从多个基于区域的文本提示进行低延迟生成。我们提出的框架可推广到任何现有的扩散模型和加速调度器,允许在成熟的图像扩散模型之上实现亚秒级(0.64 秒)的图像内容生成应用。我们的项目页面是:https://jaerinlee.com/research/semantic-draw

关键词

引用

@article{arxiv.2403.09055,
  title  = {SemanticDraw: Towards Real-Time Interactive Content Creation from Image Diffusion Models},
  author = {Jaerin Lee and Daniel Sungho Jung and Kanggeon Lee and Kyoung Mu Lee},
  journal= {arXiv preprint arXiv:2403.09055},
  year   = {2025}
}

备注

CVPR 2025 camera ready