中文

大语言模型不知道自己的决策边界:自生成反事实解释的不可靠性

机器学习 2025-09-12 v1 人工智能 计算与语言

摘要

为了有效地与人类协作,语言模型必须能够以自然语言解释其决策。我们研究了一种特定类型的自我解释:自生成的反事实解释(SCE),即模型通过修改输入以预测不同结果来解释其预测。我们评估了LLM是否能够产生有效的SCE,即实现预期效果且最小化,即仅修改必要的输入量。我们发现,LLM通常会产生有效但远非最小化的SCE,对其决策行为几乎没有提供有价值的洞察。令人担忧的是,当被要求生成最小化反事实解释时,LLM通常会进行过度小的编辑,导致预测未能改变。观察到的有效性-最小化权衡在多个LLM、数据集和评估设置下均表现一致。我们的发现表明,SCE至少在效果上是一种不够用的可解释性工具,最坏的情况下会提供关于模型行为的误导性见解。部署LLM于高风险场景的提案必须考虑不可靠自我解释对下游决策的影响。我们的代码可在 https://github.com/HarryMayne/SCEs 获取。

关键词

引用

@article{arxiv.2509.09396,
  title  = {LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations},
  author = {Harry Mayne and Ryan Othniel Kearns and Yushi Yang and Andrew M. Bean and Eoin Delaney and Chris Russell and Adam Mahdi},
  journal= {arXiv preprint arXiv:2509.09396},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main