ferret:一个用于 Transformer 解释器基准测试的框架
计算与语言
2023-09-21 v2
摘要
随着 Transformer 越来越多地被用于解决复杂的 NLP 问题,人们越来越需要其决策具有人类可解释性。尽管已经提出了若干用于解释基于 transformer 的模型输出的可解释 AI(XAI)技术,但在使用和比较这些技术方面仍然缺乏便捷的途径。我们介绍了 ferret,一个用于简化基于 transformer 的分类器上 XAI 方法使用与比较的 Python 库。借助 ferret,用户可以在任意自由文本或已有的 XAI 语料库上,使用最先进的 XAI 方法可视化和比较基于 transformer 的模型输出解释。此外,用户还可以评估特定的 XAI 指标,以选择最忠实且最合理的解释。为了与近期 Hugging Face 上共享和使用基于 transformer 的模型的统一流程相对接,ferret 直接与其 Python 库接口。在本文中,我们展示了 ferret 在情感分析和仇恨言论检测任务上对用于 transformer 的 XAI 方法进行的基准测试。我们展示了特定方法如何提供始终更优的解释,并且在 transformer 模型的语境下更受青睐。
引用
@article{arxiv.2208.01575,
title = {ferret: a Framework for Benchmarking Explainers on Transformers},
author = {Giuseppe Attanasio and Eliana Pastor and Chiara Di Bonaventura and Debora Nozza},
journal= {arXiv preprint arXiv:2208.01575},
year = {2023}
}
备注
11 pages, 3 figures. Accepted to EACL 2023 (System Demonstration). More details at https://github.com/g8a9/ferret