在非 episodic 任务中利用自省的可解释深度强化学习
机器学习
2021-08-23 v1 人工智能
摘要
可解释强化学习使人工智能体以类人的方式解释其行为,面向非专家终端用户。一种高效的解释生成替代方案是使用基于自省的方法,将 Q 值转化为成功概率,作为解释智能体决策过程的基础。该方法已有效用于 episodic 且离散的场景,然而在非 episodic 及更复杂环境中计算成功概率尚待解决。本工作中,我们调整自省方法以用于非 episodic 任务,并在由 Rainbow 算法求解的连续 Atari 游戏场景中进行了尝试。我们的初步结果表明,成功概率可由所有可能动作的 Q 值直接算出。
引用
@article{arxiv.2108.08911,
title = {Explainable Deep Reinforcement Learning Using Introspection in a Non-episodic Task},
author = {Angel Ayala and Francisco Cruz and Bruno Fernandes and Richard Dazeley},
journal= {arXiv preprint arXiv:2108.08911},
year = {2021}
}