AnchorDiff: 基于锚点图传播的多模态扩散Transformer免训练概念定位
计算机视觉与模式识别
2026-05-27 v1 人工智能
摘要
多模态扩散Transformer (MM-DiTs) 编码了丰富的表示,可用于免训练的概念定位,但现有的基于注意力的方法在视觉上易混淆的概念上常常产生重叠激活,这种失败模式我们称之为概念泄漏,即目标响应溢出到非目标对象上。为了解决这个问题,我们提出了AnchorDiff,一种免训练的定位方法,它将语义定位与结构细化解耦。AnchorDiff从概念到图像的注意力图中选择一个高置信度的锚点,并将其作为one-hot种子在从图像到图像的自注意力导出的混合图上传播。该图使用输出空间相似性进行密集的物体内传播,并使用逐行注意力门控来抑制跨物体连接。此外,我们引入了多概念混淆数据集,其中包含具有多个视觉相似概念和单独掩码的图像,从而能够明确评估概念泄漏。实验表明,AnchorDiff在ImageNet-Segmentation和PascalVOC上实现了强大的定位性能,同时在我们的多概念混淆数据集上显著减少了概念泄漏。
引用
@article{arxiv.2605.26460,
title = {AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation},
author = {Jian Zhang and Zhijun Zhang},
journal= {arXiv preprint arXiv:2605.26460},
year = {2026}
}