中文

奇点:基于部件概念的组成图像生成

计算机视觉与模式识别 2025-10-23 v2

摘要

个性化图像生成模型在从文本或单个图像生成图像方面非常高效,但缺乏对组合来自多个来源图像特定部件中对象的显式控制,而无需用户指定掩码或注释。为此,我们介绍了奇点(Chimera),一种能够根据文本指令从不同来源图像的指定部件中生成新对象的个性化图像生成模型。为训练我们的模型,我们首先构建了一个基于 464 个独特(部件、主题)对的分类学数据集,称为语义原子。从中生成 37k 个提示并使用高保真文本到图像模型合成相应图像。我们训练了一个带有部件条件引导的自定义扩散先验模型,该模型引导图像条件化特征以强制实现语义身份和空间布局。我们还引入了一个用于评估生成管道保真度和组成准确性的客观指标 PartEval。人类评估和我们提出的指标显示,奇点在部件对齐和组成准确性上比其他基线方法高出 14%,在视觉质量上高出 21%。

关键词

引用

@article{arxiv.2510.18083,
  title  = {Chimera: Compositional Image Generation using Part-based Concepting},
  author = {Shivam Singh and Yiming Chen and Agneet Chatterjee and Amit Raj and James Hays and Yezhou Yang and Chitta Baral},
  journal= {arXiv preprint arXiv:2510.18083},
  year   = {2025}
}