中文

评估基于编码器的语言模型的可解释人工智能技术有效性

计算与语言 2025-03-14 v1 人工智能 计算机与社会 机器学习

摘要

大型语言模型的黑箱特性要求开发可解释人工智能技术以实现透明度和可信度。然而,评估这些技术仍然是一个挑战。本研究提出了一个通用评估框架,使用四个关键指标:人类推理一致性、鲁棒性、一致性和对比性。我们评估了来自五个不同XAI类别的六种可解释性技术的有效性:模型简化(LIME)、基于扰动的方法(SHAP)、基于梯度的方法(InputXGradient, Grad-CAM)、逐层相关性传播(LRP)和基于注意力机制的可解释性方法(注意力机制可视化,AMV),在五个基于编码器的语言模型上:TinyBERT, BERTbase, BERTlarge, XLM-R large, 和 DeBERTa-xlarge,使用IMDB电影评论和推文情感提取数据集。我们的发现表明,基于模型简化的XAI方法(LIME)在多个指标和模型上始终表现优异,在DeBERTa-xlarge上人类推理一致性得分高达0.9685,并且随着大型语言模型复杂性的增加,在鲁棒性和一致性方面也表现出色。AMV展示了最佳的鲁棒性,得分低至0.0020。它还在一致性方面表现出色,在所有模型上实现了接近完美的0.9999得分。在对比性方面,LRP表现最佳,尤其是在更复杂的模型上,得分高达0.9371。

关键词

引用

@article{arxiv.2501.15374,
  title  = {Evaluating the Effectiveness of XAI Techniques for Encoder-Based Language Models},
  author = {Melkamu Abay Mersha and Mesay Gemeda Yigezu and Jugal Kalita},
  journal= {arXiv preprint arXiv:2501.15374},
  year   = {2025}
}