中文

从XAI到故事:大语言模型生成解释质量的阶乘研究

计算与语言 2026-03-16 v2

摘要

可解释人工智能(XAI)方法如SHAP和LIME产生的数值特征归因对非专业用户而言仍不可访问。先前的工作表明,大语言模型( LLM)可以将这些输出转化为自然语言解释( NLE),但仍不清楚哪些因素导致高质量解释。我们进行了一项系统性阶乘研究,探讨预测模型选择、XAI方法、LLM选择和提示策略如何影响NLE质量。我们的设计涵盖四个模型(XGBoost( XGB)、Random Forest( RF)、Multilayer Perceptron( MLP)和SARIMAX——比较黑箱机器学习( ML)与经典时间序列方法)、三个XAI条件( SHAP、LIME和无XAI基线)、三个LLM( GPT-4o、Llama-3-8B、DeepSeek-R1)以及八种提示策略。采用G-Eval,即以LLM为评判员的方法,配合双重LLM评判员和四个评估标准,我们评估了660个时间序列预测解释。我们的结果表明:(1) XAI仅对专家受众有小幅度改进, (2) LLM选择主导所有其他因素,DeepSeek-R1在GPT-4o和Llama-3之后表现更佳;(3)我们观察到一种可解释性悖论:在我们的设置中,SARIMAX的NLE质量低于ML模型,尽管其预测准确率更高;(4)零shot提示在成本降低7倍的情况下与自洽提示竞争;(5)链式思考反而有害于帮助。

关键词

引用

@article{arxiv.2601.02224,
  title  = {From XAI to Stories: A Factorial Study of LLM-Generated Explanation Quality},
  author = {Fabian Lukassen and Jan Herrmann and Christoph Weisser and Benjamin Saefken and Thomas Kneib},
  journal= {arXiv preprint arXiv:2601.02224},
  year   = {2026}
}