多少像素足够?SEAMS:基于 MSE 保持软掩码的充分性显著性
计算机视觉与模式识别
2026-07-10 v1
摘要
当显著性图能够识别出足以保持模型行为的图像区域时,它们最为有用。我们引入了 SEAMS,一种基于充分性的显著性方法,它使用保持目标直接优化软掩码。给定一个冻结的可微模型输出,如类别概率、CLS 嵌入或令牌表示,SEAMS 搜索一个保持所选输出的紧凑掩码。该方法依赖于一个基于软掩码、可学习预算和完全由查询图像生成的三路图像合成的简单优化框架。因此,它不需要辅助干扰数据集、特定于架构的归因机制或可微的 top-k 松弛。使用冻结的 ViT-S/16 和 ConvNeXt 模型的实验表明,相同的优化流程只需更改保持目标即可生成对象级、类别条件和令牌级解释。生成的掩码紧凑、可解释、对随机初始化稳定,并在插入和删除基准上具有竞争力。我们的结果还表明,不同的架构在实现相似的保持保真度的同时,通常依赖于不同的充分证据,这凸显了视觉解释的架构依赖性。
引用
@article{arxiv.2607.09164,
title = {What Pixels Are Enough? SEAMS: Sufficiency Saliency via MSE-Preservation Soft-Masks},
author = {Magdalena Trędowicz and Łukasz Struski and Arkadiusz Lewicki and Karolina Pachota and Andrzej Grudzień and Mateusz Jagła and Jacek Tabor},
journal= {arXiv preprint arXiv:2607.09164},
year = {2026}
}