中文

ACTER:用于解释和诊断强化学习策略的多样化且可操作的反事实序列

人工智能 2024-02-12 v1 机器学习

摘要

理解强化学习(RL)中失败是如何发生的以及如何预防,对于实现调试、维持用户信任和开发个性化策略是必不可少的。反事实推理通常被用于归咎责任和通过搜索能够避免失败的最接近可能世界来理解失败。然而,当前 RL 中的反事实状态解释只能使用当前状态特征来解释结果,并且对于如何预防负面结果没有提供可操作的对策。在本研究中,我们提出了 ACTER(用于解释强化学习结果的可操作反事实序列),这是一种生成反事实序列的算法,就如何避免失败提供可操作的建议。ACTER 研究导致失败的动作,并使用进化算法 NSGA-II 生成反事实动作序列,以最小的改变和高确定性预防失败,即使在随机环境中也是如此。此外,ACTER 生成一组多个不同的反事实序列,使用户能够以最符合其偏好的方式纠正失败。我们还引入了三个可用于评估反事实序列多样性的多样性指标。我们在两个具有离散和连续动作的 RL 环境中评估了 ACTER,并表明它可以生成可操作且多样化的反事实序列。我们进行了一项用户研究,以探索 ACTER 生成的解释如何帮助用户识别和纠正失败。

关键词

引用

@article{arxiv.2402.06503,
  title  = {ACTER: Diverse and Actionable Counterfactual Sequences for Explaining and Diagnosing RL Policies},
  author = {Jasmina Gajcin and Ivana Dusparic},
  journal= {arXiv preprint arXiv:2402.06503},
  year   = {2024}
}

备注

17 pages, 4 Figures