中文

STACHE:强化学习策略的局部黑箱解释

机器学习 2025-12-11 v1 人工智能

摘要

强化学习代理在稀疏奖励或安全关键型环境中常常会产生意外行为,这就创造了对可靠调试和验证工具的强烈需求。本文提出了STACHE,一个为强化学习代理在离散马尔可夫游戏中特定动作生成局部黑箱解释的综合框架。我们的方法产生一个由两个互补组成的复合解释:(1) 鲁棒性区域,在该区域内,代理的动作保持不变;(2) 最小反事实,在此基础上进行最小状态扰动以改变该决策。通过利用 factored 状态空间的结构,我们引入一种精确的基于搜索的算法,以规避替代模型之间的保真度差距。在 Gymnasium 环境的实证验证表明,我们的框架不仅解释了策略动作,还有效捕捉了策略逻辑在训练期间的演变——从 Erratic, 不稳定的行为到优化、稳健的策略——为代理灵敏度和决策边界提供了可操作的见解。

关键词

引用

@article{arxiv.2512.09909,
  title  = {STACHE: Local Black-Box Explanations for Reinforcement Learning Policies},
  author = {Andrew Elashkin and Orna Grumberg},
  journal= {arXiv preprint arXiv:2512.09909},
  year   = {2025}
}