xRAI:通过人工智能提取可解释表示
人工智能
2020-12-14 v1 机器学习
摘要
我们提出 xRAI,一种从训练好的神经网络中提取其本应学习的数学函数的符号表示的方法。该方法基于训练一个所谓的解释网络,该网络以训练好的网络的权重和偏置作为输入,输出网络本应学习的函数的数值表示,该表示可直接翻译为符号表示。我们展示了针对不同类型函数的解释网络可以使用布尔函数和低阶多项式作为示例在合成数据上离线训练。我们表明该训练相当高效且结果质量令人鼓舞。我们的工作旨在通过显式化目标函数,为更好地理解神经决策这一问题做出贡献。
引用
@article{arxiv.2012.06006,
title = {xRAI: Explainable Representations through AI},
author = {Christiann Bartelt and Sascha Marton and Heiner Stuckenschmidt},
journal= {arXiv preprint arXiv:2012.06006},
year = {2020}
}
备注
8 pages, 6 figures, 3 tables