中文

IV-Posterior:用于可解释策略证书的逆价值估计

机器学习 2020-12-04 v1 人工智能 机器人学

摘要

无模型强化学习(RL)是学习广泛机器人技能与策略的有力工具。然而,策略可解释性的缺乏会阻碍其在下游应用中的成功部署,尤其当环境条件差异可能导致不可预测行为或泛化失败时。因此,机器学习领域日益强调在模型中引入更强的归纳偏置以改善泛化。本文提出一种替代策略——用于可解释策略证书的逆价值估计(IV-Posterior),旨在识别预训练策略已持有的归纳偏置或理想化运行条件,并利用该信息指导其部署。IV-Posterior 使用 MaskedAutoregressive Flows 来拟合策略可能有效的条件或环境参数集合上的分布。该分布可在下游应用中作为策略证书使用。我们在两种环境中展示了 IV-Posterior 的使用,并表明当策略选择融入这些策略所持有归纳偏置的知识时,可获得显著的性能提升。

关键词

引用

@article{arxiv.2012.01925,
  title  = {IV-Posterior: Inverse Value Estimation for Interpretable Policy Certificates},
  author = {Tatiana Lopez-Guevara and Michael Burke and Nicholas K. Taylor and Kartic Subr},
  journal= {arXiv preprint arXiv:2012.01925},
  year   = {2020}
}