概念-残差模型中的解耦基准测试与增强
机器学习
2023-12-04 v1 计算机视觉与模式识别
摘要
概念瓶颈模型(CBMs)是可解释模型,其首先从观测中预测一组语义上有意义的特征(即概念),随后用于调节下游任务。然而,模型的性能强烈依赖于所设计的特征,并可能严重受限于不完整的概念集合。先前工作提出了一种旁路通道——残差——允许无约束的信息流至下游任务,从而提升模型性能,但同时引入了信息泄漏,这不利于可解释性。本工作提出三种新方法,通过解耦概念和残差来缓解信息泄漏,研究模型性能与可解释性之间的关键平衡。通过对 CUB、OAI 和 CIFAR 100 数据集的广泛实证分析,我们评估了每种解耦方法的性能,并揭示了它们最佳适用条件。此外,我们展示了每种方法如何影响对概念进行干预的能力及其对任务性能的后续影响。
引用
@article{arxiv.2312.00192,
title = {Benchmarking and Enhancing Disentanglement in Concept-Residual Models},
author = {Renos Zabounidis and Ini Oguntola and Konghao Zhao and Joseph Campbell and Simon Stepputtis and Katia Sycara},
journal= {arXiv preprint arXiv:2312.00192},
year = {2023}
}