中文

因果策略排序

人工智能 2021-11-17 v1 机器学习

摘要

通过强化学习(RL)训练得到的策略即便对于简单任务也常常非常复杂。在一个包含 nn 个时间步的轨迹中,策略将就采取的动作做出 nn 个决策,其中许多对观察者而言可能显得不直观。此外,并不清楚这些决策中哪些直接促成了奖励的获取,以及它们的贡献有多大。给定一个训练好的策略,我们提出了一种基于反事实推理的黑盒方法,用于估计这些决策对奖励获取的因果效应,并依据该估计对决策进行排序。在这项初步工作中,我们将我们的度量与一种替代性的、非因果的排序方法进行比较,凸显基于因果性的策略排序的益处,并讨论了将因果算法整合进 RL 智能体策略解释的未来工作。

关键词

引用

@article{arxiv.2111.08415,
  title  = {Causal policy ranking},
  author = {Daniel McNamee and Hana Chockler},
  journal= {arXiv preprint arXiv:2111.08415},
  year   = {2021}
}

备注

preprint; 6 pages. arXiv admin note: substantial text overlap with arXiv:2008.13607