中文

DEIG:基于细粒度语义控制的细节增强多实例生成

计算机视觉与模式识别 2026-02-23 v1

摘要

多实例生成在空间布局和属性绑定方面取得了显著进展。然而,现有方法在细粒度语义理解方面仍面临挑战,尤其是处理复杂文本描述时。为克服这些限制,我们提出了DEIG,一个用于细粒度且可控的多实例生成的新框架。DEIG集成了一个实例细节提取器(IDE),将文本编码器嵌入转换为紧凑、实例感知的表示,以及一个细节融合模块(DFM),其应用实例基准的掩码注意力以防止跨实例属性泄漏。这些组件使DEIG能够生成与丰富、局部化文本描述高度一致的视觉连贯多实例场景。为支持细粒度监督,我们构建了一个由视觉语言模型(VLM)生成的高质量数据集,包含详细的、由实例组成的标题。我们还引入了DEIG-Bench,一个新的基准,包含区域级别的注释和用于人类和对象的多属性提示。实验表明,DEIG在多个基准上在空间一致性、语义准确性和组成性泛化方面 consistently 优于现有方法。此外,DEIG可以作为即插即用的模块,轻松集成到标准基于扩散的管道中。

关键词

引用

@article{arxiv.2602.18282,
  title  = {DEIG: Detail-Enhanced Instance Generation with Fine-Grained Semantic Control},
  author = {Shiyan Du and Conghan Yue and Xinyu Cheng and Dongyu Zhang},
  journal= {arXiv preprint arXiv:2602.18282},
  year   = {2026}
}

备注

Accepted by AAAI 2026