中文

几何可编辑与外观保持的物体合成

计算机视觉与模式识别 2026-05-19 v2

摘要

通用物体合成(GOC)旨在将目标物体无缝集成到具有所需几何属性的背景场景中,同时保留其细粒度的外观细节。近期的方法导出语义嵌入并将其集成到先进的扩散模型中,以实现几何可编辑的生成。然而,这些高度紧凑的嵌入仅编码了高层语义线索,不可避免地丢弃了细粒度的外观细节。我们引入了解耦的几何可编辑与外观保持扩散(DGAD)模型,该模型首先利用语义嵌入隐式捕获所需的几何变换,然后采用交叉注意力检索机制将细粒度的外观特征与几何编辑后的表示对齐,从而在物体合成中实现精确的几何编辑和忠实的外观保持。具体而言,DGAD 基于 CLIP/DINO 派生的网络和参考网络来提取语义嵌入和外观保持表示,然后以解耦的方式将它们无缝集成到编码和解码流水线中。我们首先将语义嵌入集成到具有强大空间推理能力的预训练扩散模型中,以隐式捕获物体几何,从而促进灵活的物体操控并确保有效的可编辑性。然后,我们设计了一种密集交叉注意力机制,利用隐式学习的物体几何来检索外观特征并将其与对应区域进行空间对齐,确保忠实的外观一致性。在公共基准上的大量实验证明了所提出的 DGAD 框架的有效性。

关键词

引用

@article{arxiv.2505.20914,
  title  = {Geometry-Editable and Appearance-Preserving Object Compositon},
  author = {Jianman Lin and Haojie Li and Chunmei Qing and Zhijing Yang and Liang Lin and Tianshui Chen},
  journal= {arXiv preprint arXiv:2505.20914},
  year   = {2026}
}