中文

学习序贯决策制定的“假设”解释

机器学习 2021-03-31 v3 人工智能 机器学习

摘要

基于示范行为(即专家在最大化某未知奖励函数时所做出的观测与动作轨迹)构建真实世界决策的可解释参数化,对于不同机构中策略的内省与审计至关重要。本文提出通过对专家奖励函数建模为关于‘假设’结果的偏好来学习专家决策的解释:给定当前观测历史,如果我们采取某特定动作会发生什么?为学习这些与专家动作相关的成本-收益权衡,我们将反事实推理整合进批量逆强化学习。这提供了定义奖励函数并解释专家行为的原理性方法,且满足真实世界决策制定的约束——其中主动实验通常不可能(例如医疗中)。此外,通过估计不同动作的效果,反事实 readily 解决批量设定下策略评估的离屏性质,并可自然适应专家策略依赖于观测历史而非仅当前状态的设定。通过在真实与模拟医疗环境中的说明性实验,我们凸显了批量反事实逆强化学习方法在恢复准确且可解释的行为描述方面的有效性。

关键词

引用

@article{arxiv.2007.13531,
  title  = {Learning "What-if" Explanations for Sequential Decision-Making},
  author = {Ioana Bica and Daniel Jarrett and Alihan Hüyük and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2007.13531},
  year   = {2021}
}

备注

In Proc. 9th International Conference on Learning Representations (ICLR 2021)