具有细粒度可解释性的自奖励设计
机器学习
2023-01-24 v3 人工智能
摘要
深度神经网络(DNN)的黑箱性质引发了关于透明性与公平性的关注。深度强化学习(Deep RL 或 DRL)使用 DNN 来学习其策略、价值函数等,因此也面临类似的担忧。本文提出一种通过具有详细可解释性的神经网络的自下而上设计来规避这些问题的方法,其中每个神经元或层都具有对应于人类可理解概念自身的含义与效用。本文引入的框架称为自奖励设计(Self Reward Design, SRD),其受逆奖励设计启发,并且这种可解释设计能够(1)通过纯设计(尽管不完美)解决问题,以及(2)像标准 DNN 一样被优化。通过精心的人为设计,我们展示了一些 RL 问题(如 lavaland 和 MuJoCo)可以使用由标准 NN 组件构建的、参数量很少的模型来解决。此外,通过我们的鱼类销售拍卖示例,我们展示了 SRD 如何用于应对若使用黑箱模型则无意义、而需要基于人类可理解语义的决策的情形。
引用
@article{arxiv.2112.15034,
title = {Self Reward Design with Fine-grained Interpretability},
author = {Erico Tjoa and Guan Cuntai},
journal= {arXiv preprint arXiv:2112.15034},
year = {2023}
}