中文

AnyDoor:零样本物体级图像定制

计算机视觉与模式识别 2024-05-09 v2

摘要

本工作提出 AnyDoor,一种基于扩散模型的图像生成器,能够以和谐方式将目标物体传送至用户指定位置的新场景中。我们的模型仅训练一次,而非针对每个物体调整参数,并在推理阶段轻松泛化到多样的物体-场景组合。这种具有挑战性的零样本设定需要对特定物体进行充分刻画。为此,我们在常用身份特征之外补充了细节特征,其经过精心设计以保留纹理细节同时允许多样的局部变化(如光照、朝向、姿态等),使物体能更好地与不同环境融合。我们进一步提出从视频数据集借力,从中可观察到单一物体的多种形式(即沿时间轴),从而提升模型的泛化性与鲁棒性。大量实验证明了我们的方法相对于现有替代方案的优越性,以及其在虚拟试穿、物体移动等真实应用中的巨大潜力。项目页面为 https://damo-vilab.github.io/AnyDoor-Page/。

关键词

引用

@article{arxiv.2307.09481,
  title  = {AnyDoor: Zero-shot Object-level Image Customization},
  author = {Xi Chen and Lianghua Huang and Yu Liu and Yujun Shen and Deli Zhao and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2307.09481},
  year   = {2024}
}

备注

CVPR2024