中文

黑盒NLP模型解释:综述

机器学习 2022-04-01 v1 人工智能 计算与语言 信息检索

摘要

越来越多的机器学习模型已部署在金融和医疗等高风险领域。尽管性能优越,许多模型本质上是黑盒,难以解释。研究人员为开发解释这些黑盒模型的方法付出了日益增长的努力。基于扰动的事后解释(如 LIME)是广泛使用的在模型构建后对其进行解释的方法。这类方法已被证明存在较大的不稳定性,对方法本身的有效性提出严重挑战并损害用户信任。在本文中,我们提出 S-LIME,其利用基于中心极限定理的假设检验框架来确定保证所得解释稳定性所需的扰动点数量。在模拟和真实世界数据集上的实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2203.17081,
  title  = {Interpretation of Black Box NLP Models: A Survey},
  author = {Shivani Choudhary and Niladri Chatterjee and Subir Kumar Saha},
  journal= {arXiv preprint arXiv:2203.17081},
  year   = {2022}
}