带推理器的优势 actor-critic:从探索视角解释智能体行为
人工智能
2023-09-12 v1 机器学习
摘要
强化学习(RL)是解决复杂决策问题的有力工具,但其缺乏透明性和可解释性,在决策具有重大现实影响的领域中一直是一个主要挑战。本文提出一种新颖的带推理器的优势 Actor-Critic(A2CR),它可轻松应用于基于 Actor-Critic 的 RL 模型并使其具备可解释性。A2CR 由三个相互连接的网络组成:策略网络、价值网络和推理器网络。通过预定义并对执行者动作的内在目的进行分类,A2CR 自动生成更全面且可解释的范式以理解智能体的决策过程。它提供一系列功能,如基于目的显著图、早期失败检测和模型监督,从而促进负责任且可信赖的 RL。在动作丰富的超级马里奥兄弟(Super Mario Bros)环境中进行的评估得出了有趣发现:随着 RL 算法探索程度的加剧,推理器预测的标签比例在“Breakout”中下降,在“Hovering”中上升。此外,基于目的的显著图更加聚焦且易于理解。
引用
@article{arxiv.2309.04707,
title = {Advantage Actor-Critic with Reasoner: Explaining the Agent's Behavior from an Exploratory Perspective},
author = {Muzhe Guo and Feixu Yu and Tian Lan and Fang Jin},
journal= {arXiv preprint arXiv:2309.04707},
year = {2023}
}