SUB:通过合成属性置换评估 CBM 的泛化性
计算机视觉与模式识别
2025-08-01 v1 人工智能
机器学习
摘要
概念瓶颈模型 (CBM) 以及其他基于概念的可解释模型在提高 AI 应用透明度方面显示出巨大的潜力,这对于医学等领域至关重要。尽管取得了成功,但我们展示了 CBM 在分布偏移下难以可靠地识别正确概念。为评估 CBM 对概念变化的鲁棒性,我们引入 SUB:一个包含 38,400 个合成图像的数据集和概念基准,基于 CUB 数据集构建。为创建 SUB,我们选取 CUB 数据集的子集,包括 33 类鸟类和 45 个概念,生成替换特定概念(如翅膀颜色或腹部图案)的图像。我们引入一种新颖的 Tied Diffusion Guidance (TDG) 方法,以精确控制生成图像,其中噪声共享用于两个平行去噪过程,以确保正确的鸟类类别和正确的属性均被生成。这个新颖的基准使我们能够对 CBM 和类似可解释模型进行严格评估,促进更健壮方法的开发。我们的代码已在 https://github.com/ExplainableML/sub 提供,数据集位于 http://huggingface.co/datasets/Jessica-bader/SUB。
引用
@article{arxiv.2507.23784,
title = {SUB: Benchmarking CBM Generalization via Synthetic Attribute Substitutions},
author = {Jessica Bader and Leander Girrbach and Stephan Alaniz and Zeynep Akata},
journal= {arXiv preprint arXiv:2507.23784},
year = {2025}
}
备注
Accepted at ICCV 2025