中文

IxDRL:基于趣味性分析的新型可解释深度强化学习工具包

人工智能 2023-07-19 v1 人机交互 机器学习

摘要

近年来,深度学习的进展使得强化学习(RL)在解决具有高维输入的复杂序贯决策任务方面取得了大量成功。然而,现有系统缺乏向人类提供其能力整体视图的必要机制,这阻碍了它们的采用,特别是在智能体所作决策可能产生重大后果的关键应用中。然而,现有基于 RL 的系统本质上缺乏能力感知,因为它们缺少必要的解释机制以让人类操作员对其能力有深入、整体的认识。面向更具可解释性的深度 RL(xDRL),我们提出了一种基于趣味性分析的新框架。我们的工具提供了源于趣味性分析的多种 RL 智能体能力度量,适用于广泛的 RL 算法,并原生支持流行的 RLLib 工具包。我们通过在一系列不同复杂度的场景中应用所提出的流程来展示我们框架的使用。我们基于全局和局部的趣味性分析,实证评估了该方法在识别智能体行为模式与能力控制条件,以及对智能体能力负主要责任的任务元素方面的能力。总体而言,我们表明我们的框架能够为智能体设计者提供关于 RL 智能体能力(包括其能力与局限)的洞察,从而在协作人机环境中支持关于干预、额外训练及其他交互的更明智决策。

关键词

引用

@article{arxiv.2307.08933,
  title  = {IxDRL: A Novel Explainable Deep Reinforcement Learning Toolkit based on Analyses of Interestingness},
  author = {Pedro Sequeira and Melinda Gervasio},
  journal= {arXiv preprint arXiv:2307.08933},
  year   = {2023}
}

备注

To be published in the Proceedings of the 1st World Conference on eXplainable Artificial Intelligence (xAI 2023). arXiv admin note: substantial text overlap with arXiv:2211.06376