TweedieMix:改进基于扩散的图像/视频生成中的多概念融合
计算机视觉与模式识别
2025-03-05 v2
摘要
尽管在定制文本到图像和视频生成模型方面取得了显著进展,但生成有效整合多个个性化概念的图像和视频仍然是一项具有挑战性的任务。为此,我们提出了TweedieMix,一种在推理阶段组合定制扩散模型的新方法。通过分析反向扩散采样的特性,我们的方法将采样过程分为两个阶段。在初始步骤中,我们应用多目标感知采样技术以确保包含所需的目标对象。在后续步骤中,我们使用Tweedie公式在去噪图像空间中混合自定义概念的外观。我们的结果表明,TweedieMix能够以比现有方法更高的保真度生成多个个性化概念。此外,我们的框架可以轻松扩展到图像到视频的扩散模型,从而生成包含多个个性化概念的视频。结果和源代码可在我们的匿名项目页面中找到。
引用
@article{arxiv.2410.05591,
title = {TweedieMix: Improving Multi-Concept Fusion for Diffusion-based Image/Video Generation},
author = {Gihyun Kwon and Jong Chul Ye},
journal= {arXiv preprint arXiv:2410.05591},
year = {2025}
}
备注
Github Page: https://github.com/KwonGihyun/TweedieMix