中文

ICE:基于统计 grounding 的干预一致解释评估

计算与语言 2026-03-20 v1 人工智能 机器学习

摘要

评估解释是否忠实地反映模型推理仍是一个开放问题。现有基准测试在单个干预上进行,缺乏统计检验,难以区分真正的忠诚度与偶然水平性能。我们引入ICE(Intervention-Consistent Explanation),一个框架,通过随机化检验将解释与匹配的随机基线进行比较,在多种干预算子下进行,生成具有置信区间的胜率。我们评估了7个大语言模型,在4个英文任务、6个非英文语言和2种归因方法中进行。我们发现,忠诚度取决于干预算子:算子间的差距可达44个百分点,在短文本上删除通常会高估估计值,但在长文本上的模式则相反,这表明忠诚度应在干预算子之间进行比较,而不是作为单一分数。随机化基线揭示了1/3的配置中存在反忠诚,忠诚度与人类可信度之间几乎没有相关性(|r| < 0.04)。多语言评估揭示了模型-语言之间的显著交互作用,这不仅仅是由分词导致的。我们发布了ICE框架和ICEBench基准。

关键词

引用

@article{arxiv.2603.18579,
  title  = {ICE: Intervention-Consistent Explanation Evaluation with Statistical Grounding for LLMs},
  author = {Abhinaba Basu and Pavan Chakraborty},
  journal= {arXiv preprint arXiv:2603.18579},
  year   = {2026}
}