ObjectMate:面向对象插入与主体驱动生成的递归先验
计算机视觉与模式识别
2024-12-12 v1
摘要
本文引入一种无需调参的方法,用于对象插入和主体驱动生成。这一任务涉及将给定多个视角的对象合成到由图像或文本指定的场景中。现有方法难以完全满足任务的挑战性目标:(i) 以准似实的方式将对象无缝合成到场景中,包括逼真的姿态和光照;(ii) 保存对象的身份。我们推断,要实现上述目标需要大规模监督,但手动收集足够数据成本过高。本文的关键观察是,许多大规模无标记数据集中的 mass-produced 对象在不同场景、姿态和光照条件下反复出现。我们利用这一观察通过检索同一对象的多样化视角集合来创建大规模监督数据。这种强大的配对数据集使我们能够训练一个简单的文本到图像扩散模型,将对象和场景描述映射到合成图像。我们将 ObjectMate 与用于对象插入和主体驱动生成的 SOTA 方法进行比较,使用 single 或 multiple references。实证结果表明,ObjectMate 在保持身份和更准似实的合成方面均优于先前方法。不同于许多其他多参考方法,ObjectMate 不需要慢速的测试时调参。
引用
@article{arxiv.2412.08645,
title = {ObjectMate: A Recurrence Prior for Object Insertion and Subject-Driven Generation},
author = {Daniel Winter and Asaf Shul and Matan Cohen and Dana Berman and Yael Pritch and Alex Rav-Acha and Yedid Hoshen},
journal= {arXiv preprint arXiv:2412.08645},
year = {2024}
}