中文

TKG-DM:训练-free 色键内容生成扩散模型

计算机视觉与模式识别 2025-08-05 v3

摘要

扩散模型已实现对现实感和文本保真度的高质量图像生成。然而,大规模文本到图像模型(如 Stable Diffusion)在生成带有色键背景的前景对象图像方面存在困难,限制了其在无需微调的情况下分离前景和背景元素的能力。为此,我们提出一种 novel 训练-free 色键内容生成扩散模型(TKG-DM),通过优化初始随机噪声以生成前景对象置于指定颜色背景的图像。我们的方法首次探索了初始噪声中颜色方面的操控,以实现受控背景生成,从而在无需微调的情况下实现前景与背景的精确分离。大量实验表明,我们的训练-free 方法在定性和定量评估方面均优于现有方法,甚至能匹配或超越微调模型。最后,我们成功将其扩展到其他任务(如一致性模型和文本到视频),凸显了其在需要独立控制前景和背景的各类生成应用中的变革性潜力。

关键词

引用

@article{arxiv.2411.15580,
  title  = {TKG-DM: Training-free Chroma Key Content Generation Diffusion Model},
  author = {Ryugo Morita and Stanislav Frolov and Brian Bernhard Moser and Takahiro Shirakawa and Ko Watanabe and Andreas Dengel and Jinjia Zhou},
  journal= {arXiv preprint arXiv:2411.15580},
  year   = {2025}
}

备注

Accepted to CVPR2025(Highlight). Code at: https://github.com/ryugo417/TKG-DM