质量却无用:LLM 生成的 XAI 叙述作为信任启发式因素
计算与语言
2026-05-27 v1
摘要
先前的研究表明,大型语言模型(LLM)可以将可解释人工智能(XAI)输出转化为自然语言解释(NLE),这些解释在如同似性、连贯性和易理解性等质量指标上得分很高。但解释的质量是否转化为实际的实用性?我们通过五个受控实验(涵盖 60 个测试实例,累计 2,730 项判断)在时间序列能源预测领域探讨了这一问题。每项实验都操作化了 XAI 文献中所研究的不同实用性方面。保持 NLE 的质量在高水平(基于前一阶实验的设定)不变,我们发现尽管 NLE 在质量上表现良好,但在五个任务中均未提升任务准确率,反而导致自我报告的信心水平上升。一项盲检对照显示,这种信心提升是由文本存在而非内容所致。在一种超出分布检测任务中,NLE 降低了 LLM 判官识别不可靠预测的能力,提供了一种虚假的安慰,掩盖了模型失效。我们将这些发现表述为质量-实用性鸿沟,主张 XAI 到 NLE 管道的评估必须扩展到下游任务性能,而不仅仅是文本质量指标。
引用
@article{arxiv.2605.26770,
title = {Quality Without Usefulness: LLM-Generated XAI Narratives as Trust Heuristics Rather Than Decision Aids},
author = {Fabian Lukassen and Jan Herrmann and Christoph Weisser and Alexander Silbersdorff and Benjamin Saefken and Thomas Kneib},
journal= {arXiv preprint arXiv:2605.26770},
year = {2026}
}