FreeInsert:基于几何与风格控制的个性化对象插入
计算机视觉与模式识别
2025-09-26 v1
摘要
文本到图像扩散模型在图像生成方面取得了显著进展,使得自定义生成变得轻松便捷。然而,现有的图像编辑方法在处理个性化图像组成任务时仍面临一些局限。首先,缺乏对插入对象进行几何控制的问题。当前方法局限于二维空间,通常依赖文本指令,难以对对象进行精确的几何控制。其次,存在风格一致性的挑战。现有方法常忽视插入对象与背景之间的风格一致性,导致真实性不足。此外,插入对象到图像中而无需大量训练的挑战仍然显著。为此,我们提出了\textit{FreeInsert},一个无需训练的新型框架,通过利用3D几何信息对任意场景进行对象插入。凭借对现有3D生成模型的进展,我们首先将二维对象转换为3D,在3D层面进行交互式编辑,然后从指定视角重新渲染为二维图像。该过程引入了诸如形状或视点的几何控制。渲染图像作为几何控制,与通过扩散适配器实现的风格和内容控制相结合,最终通过扩散模型生成具有几何控制和风格一致性的编辑图像。
引用
@article{arxiv.2509.20756,
title = {FreeInsert: Personalized Object Insertion with Geometric and Style Control},
author = {Yuhong Zhang and Han Wang and Yiwen Wang and Rong Xie and Li Song},
journal= {arXiv preprint arXiv:2509.20756},
year = {2025}
}