中文

衡量LLM生成XAI叙述质量的量化指标

计算与语言 2024-12-16 v1 人工智能

摘要

LLM在XAI中的一个快速发展应用是将定量解释(如SHAP)转换为面向用户的友好叙述,以解释来自小型预测模型所做出的决策。在此背景下,越来越重要的是一种不依赖人类偏好研究或调查即可评估LLM生成叙述的方法。本文提出了一套框架并探索了几种用于评估表格分类任务XAI叙述的LLM生成指标。我们将方法应用于比较来自不同数据集和不同提示类型下的多个最先进LLM。作为其实用性的演示,这些指标使我们能够识别LLM在XAI叙述中存在的新挑战,即幻觉现象。

关键词

引用

@article{arxiv.2412.10220,
  title  = {How good is my story? Towards quantitative metrics for evaluating LLM-generated XAI narratives},
  author = {Timour Ichmoukhamedov and James Hinns and David Martens},
  journal= {arXiv preprint arXiv:2412.10220},
  year   = {2024}
}