中文

MagicMix:基于扩散模型的语义混合

计算机视觉与模式识别 2022-10-31 v1

摘要

你曾想象过类似柯基的咖啡机或类似老虎的兔子长什么样吗?在本文中,我们通过探索一项称为语义混合的新任务来尝试回答这些问题,旨在融合两种不同语义以创造新概念(例如,柯基+咖啡机→类似柯基的咖啡机)。与风格迁移不同——风格迁移在不改变图像内容的情况下依据参考风格对图像进行风格化——语义混合以语义方式混合两个不同概念以合成新概念,同时保留空间布局与几何结构。为此,我们提出MagicMix,一种基于预训练文本条件扩散模型的简单而有效的方案。受扩散模型渐进生成特性的启发(布局/形状在去噪早期步骤出现,而语义上有意义的细节在去噪后期步骤出现),我们的方法首先获得粗略布局(通过破坏图像或根据给定的文本提示从纯高斯噪声去噪),随后注入条件提示以进行语义混合。我们的方法无需任何空间掩码或重新训练,却能够高保真地合成新物体。为提升混合质量,我们进一步设计两种简单策略,以对合成内容提供更好的控制与灵活性。借助我们的方法,我们在多种下游应用上展示了结果,包括语义风格迁移、新物体合成、品种混合与概念移除,证明了方法的灵活性。更多结果见项目页 https://magicmix.github.io

关键词

引用

@article{arxiv.2210.16056,
  title  = {MagicMix: Semantic Mixing with Diffusion Models},
  author = {Jun Hao Liew and Hanshu Yan and Daquan Zhou and Jiashi Feng},
  journal= {arXiv preprint arXiv:2210.16056},
  year   = {2022}
}