桥接可解释性与嵌入:BEE 关注虚假关联
人工智能
2026-02-12 v5 机器学习
摘要
当前检测虚假关联的方法依赖于分析数据集统计信息或错误模式,导致许多有害捷径在无反例时难以被发现。我们提出BEE(Bridging Explainability and Embeddings),一个将注意力从模型预测转向权重空间及其决定性嵌入几何的框架。通过分析微调如何扰动预训练表示,BEE揭示了常规评估管道中难以发现的虚假关联。我们采用线性探针作为透明诊断镜头,揭示出在完全微调后仍持续且跨越 diverse state-of-the-art 模型的虚假特征。我们的实验覆盖诸多数据集和领域:视觉(Waterbirds、CelebA、ImageNet-1k)、语言(CivilComments、MIMIC-CXR医疗笔记)以及多种嵌入家族(CLIP、CLIP-DataComp.XL、mGTE、BLIP2、SigLIP2)。BEE持续揭示虚假关联:从显著降低ImageNet准确率的概念(最高降低95%),到MIMIC-CXR笔记中导致危险误诊的临床捷径。综上,这些结果将BEE定位为诊断权空间中虚假关联的通用且原则工具,使数据集审计和更可信的基础模型成为可能。源码已公开于https://github.com/bit-ml/bee。
引用
@article{arxiv.2410.18970,
title = {Bridging Explainability and Embeddings: BEE Aware of Spuriousness},
author = {Cristian Daniel Păduraru and Antonio Bărbălau and Radu Filipescu and Andrei Liviu Nicolicioiu and Elena Burceanu},
journal= {arXiv preprint arXiv:2410.18970},
year = {2026}
}
备注
ICLR 2026