LIBERTy:基于结构反事实的 LLM 概念解释性基准的因果框架
计算与语言
2026-01-21 v2 人工智能
摘要
概念解释用于量化高层次概念(如性别或经验)对模型行为的影响,这对于高风险领域的决策者至关重要。最近的工作通过将其与从反事实中估计的参考因果效应进行比较来评估此类解释的忠实度。在实际中,现有基准依赖昂贵的人工编写的反事实,这些反事实作为不完美的代理。为此,我们引入了一个构建包含结构反事实对的数据集框架:LIBERTy(LLM 基于干预的解释性基准,参考目标)。LIBERTy 建立在明确定义的结构因果模型(SCM)之上,其中对概念的干预会通过 SCM 直至 LLM 生成反事实。我们引入了三个数据集(疾病检测、医学影像筛查和职场暴力预测),并提出了一种新的评估指标——有序忠实度。使用这些数据集,我们评估了五个模型中各种方法的表现,发现提升概念解释还有很大的潜力。LIBERTy 还 enables 对模型对干预的敏感性进行系统性分析:我们发现专有 LLM 对人口统计概念的敏感性显著降低,这可能是由于后训练中的缓解。总体而言,LIBERTy 为开发可靠的解释性方法提供了所需的基准。
引用
@article{arxiv.2601.10700,
title = {LIBERTy: A Causal Framework for Benchmarking Concept-Based Explanations of LLMs with Structural Counterfactuals},
author = {Gilat Toker and Nitay Calderon and Ohad Amosy and Roi Reichart},
journal= {arXiv preprint arXiv:2601.10700},
year = {2026}
}