ISAC:用于改善多实例生成的免训练实例到语义注意力控制
计算机视觉与模式识别
2025-11-27 v2
摘要
文本到图像扩散模型近期已变得高度强大,但其在多目标场景中的行为仍然不可靠:模型经常生成错误数量的实例,并表现出跨目标的语义泄漏。我们将这些失败追溯到模糊的实例边界;自注意力在去噪过程的早期就已经揭示了实例布局,但现有方法仅作用于语义信号。我们引入了(nstance-to-emantic ttention ontrol,实例到语义注意力控制),一种免训练、模型无关的目标,通过首先从自注意力中划分出实例布局,然后将语义绑定到这些实例上,来执行分层注意力控制。在第一阶段,ISAC将自注意力聚类为相应数量的实例并排斥重叠,建立实例级的结构层次;在第二阶段,它将这些实例线索注入到交叉注意力中以获得实例感知的语义掩码,并通过将属性绑定在每个实例内来分解混合语义。ISAC在T2I-CompBench、HRS-Bench和IntraCompBench(我们针对类内组合提出的新基准,该场景下失败最为频繁)上取得了一致的提升,在IntraCompBench上多类准确率提升了至少50%,多实例准确率提升了7%,且无需任何微调或外部模型。除了文本到图像设置外,ISAC还通过将粗糙的边界框布局细化为密集的实例掩码,增强了重叠边界框下的布局到图像控制器,这表明实例形成和语义分配的分层解耦是稳健、可控的多目标生成的关键原则。代码将在发表后发布。
引用
@article{arxiv.2505.20935,
title = {ISAC: Training-Free Instance-to-Semantic Attention Control for Improving Multi-Instance Generation},
author = {Sanghyun Jo and Wooyeol Lee and Ziseok Lee and Kyungsu Kim},
journal= {arXiv preprint arXiv:2505.20935},
year = {2025}
}
备注
36 pages