用于评估大语言模型中可解释AI技术有效性的统一框架与新型指标
计算与语言
2025-04-09 v2 人工智能
机器学习
摘要
LLM日益增长的复杂性对其透明度和可解释性提出了重大挑战,需要使用可解释AI技术(XAI)来增强可信度和可用性。本研究引入了一个全面的评估框架,包含四个新型指标,用于评估五种XAI技术在五个LLM和两个下游任务上的有效性。我们应用该框架,使用IMDB电影评论和推文情感提取数据集评估了LIME、SHAP、积分梯度、逐层相关传播(LRP)和注意力机制可视化(AMV)等XAI技术。评估聚焦于四个关键指标:人类推理一致性(HA)、鲁棒性、一致性和对比性。我们的结果表明,LIME在多个LLM和评估指标上持续获得高分,而AMV表现出优越的鲁棒性和接近完美的一致性。LRP在对比性方面表现出色,尤其是在更复杂的模型上。我们的发现为不同XAI方法的优势和局限性提供了有价值的见解,为开发和选择适当的LLM XAI技术提供了指导。
引用
@article{arxiv.2503.05050,
title = {A Unified Framework with Novel Metrics for Evaluating the Effectiveness of XAI Techniques in LLMs},
author = {Melkamu Abay Mersha and Mesay Gemeda Yigezu and Hassan Shakil and Ali K. AlShami and Sanghyun Byun and Jugal Kalita},
journal= {arXiv preprint arXiv:2503.05050},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2501.15374