中文

CustAny:从单个示例定制任意对象

计算机视觉与模式识别 2024-11-26 v4

摘要

扩散式文本到图像模型的近期进步简化了高保真图像的创建,但在保留特定元素(如个人狗狗)的身份信息(ID)方面仍存在挑战。对象定制方法利用参考图像和文本描述是解决此问题的关键。当前的对象定制方法要么是针对特定对象的,需要大量微调;要么是无对象特定性的,提供零射出定制但仅限于特定领域。推动从特定领域向通用领域实现零射出对象定制的主要问题在于,缺乏用于模型预训练的大规模通用 ID 数据集,这既耗时又费力。本文提出了一种新型管道,用于构建通用对象的大规模数据集,并构建了具备 31.5 万个文本-图像样本、覆盖 1 万个类别的 Multi-Category ID-Consistent(MC-IDC)数据集。借助 MC-IDC,我们引入了零射出通用对象定制框架 CustAny,能够保持 ID 保真度并支持灵活的文本编辑。CustAny 的三个关键组件包括通用 ID 提取模块、双层 ID 注入模块和 ID感知解耦模块,使其能够从单个参考图像和文本提示中对任何对象进行定制。实验表明,CustAny 在通用对象定制以及人类定制和虚拟试穿等特定领域均优于现有方法。我们的贡献包括大规模数据集、CustAny 框架以及创新的 ID 处理技术,以推动该领域的发展。代码和数据集将很快在 https://github.com/LingjieKong-fdu/CustAny 上发布。

关键词

引用

@article{arxiv.2406.11643,
  title  = {CustAny: Customizing Anything from A Single Example},
  author = {Lingjie Kong and Kai Wu and Xiaobin Hu and Wenhui Han and Jinlong Peng and Chengming Xu and Donghao Luo and Mengtian Li and Jiangning Zhang and Chengjie Wang and Yanwei Fu},
  journal= {arXiv preprint arXiv:2406.11643},
  year   = {2024}
}