CustomNet:文本到图像扩散模型中支持可变视角的零样本物体定制
计算机视觉与模式识别
2023-12-08 v2 人工智能
摘要
将定制物体融入图像生成是文本到图像生成中一项颇具吸引力的功能。然而,现有的基于优化和基于编码器的方法存在耗时优化、身份保持不足以及普遍存在的复制粘贴效应等缺陷。为克服这些局限,我们提出 CustomNet,一种新颖的物体定制方法,其将 3D 新视角合成能力显式地引入物体定制过程。该整合有助于调整空间位置关系和视角,在有效保持物体身份的同时产生多样化输出。此外,我们引入了精细设计,通过文本描述或特定用户定义图像实现位置控制和灵活的背景控制,克服了现有 3D 新视角合成方法的限制。我们进一步利用能够更好地处理真实世界物体和复杂背景的数据集构建流程。借助这些设计,我们的方法无需测试时优化即可实现零样本物体定制,并同时控制视角、位置和背景。因此,我们的 CustomNet 确保了增强的身份保持并生成多样且和谐的产出。
引用
@article{arxiv.2310.19784,
title = {CustomNet: Zero-shot Object Customization with Variable-Viewpoints in Text-to-Image Diffusion Models},
author = {Ziyang Yuan and Mingdeng Cao and Xintao Wang and Zhongang Qi and Chun Yuan and Ying Shan},
journal= {arXiv preprint arXiv:2310.19784},
year = {2023}
}
备注
Project webpage available at https://jiangyzy.github.io/CustomNet/