面向神经自然语言处理的事后可解释性:综述
计算与语言
2023-11-29 v5 机器学习
神经与进化计算
摘要
用于自然语言处理(NLP)的神经网络正变得日益复杂且广泛应用,人们越来越关注这些模型是否值得负责任地使用。解释模型有助于解决安全与伦理问题,并对问责至关重要。可解释性旨在以人类可理解的方式提供这些解释。此外,事后方法在模型学习完成后提供解释,且通常为模型无关。本综述对近期事后可解释性方法如何向人类传达解释进行了分类,深入讨论了每种方法,以及它们如何被验证,因为后者常是一个普遍关注的问题。
引用
@article{arxiv.2108.04840,
title = {Post-hoc Interpretability for Neural NLP: A Survey},
author = {Andreas Madsen and Siva Reddy and Sarath Chandar},
journal= {arXiv preprint arXiv:2108.04840},
year = {2023}
}