中文

反事实概念瓶颈模型

机器学习 2025-02-21 v3 人工智能

摘要

当前的深度学习模型并非旨在同时解决三个基本问题:预测类别标签以解决给定的分类任务(“是什么?”),模拟情境变化以评估这如何影响类别预测(“如何?”),以及设想情境应如何改变以导致不同的类别预测(“为什么不?”)。无法回答这些问题,是部署可靠AI智能体、校准人类信任以及改善人机交互方面的一个关键缺口。为了弥合这一缺口,我们引入了反事实概念瓶颈模型(CF-CBMs),这是一类旨在高效地一次性解决上述所有查询,而无需运行事后搜索的模型。我们的实验结果表明,CF-CBMs:实现了与黑箱模型和现有CBM相当的分类准确率(“是什么?”),依赖更少的重要概念从而产生更简单的解释(“为什么?”),并产生可解释的、基于概念的反事实(“为什么不?”)。此外,我们表明,将反事实生成器与CBM联合训练会带来两个关键改进:(i) 它改变了模型的决策过程,使模型依赖更少的重要概念(导致更简单的解释),以及 (ii) 它显著增加了概念干预对类别预测的因果效应,使模型对这些变化更敏感。

关键词

引用

@article{arxiv.2402.01408,
  title  = {Counterfactual Concept Bottleneck Models},
  author = {Gabriele Dominici and Pietro Barbiero and Francesco Giannini and Martin Gjoreski and Giuseppe Marra and Marc Langheinrich},
  journal= {arXiv preprint arXiv:2402.01408},
  year   = {2025}
}