中文

策略优化中的不变性与奖励学习中的部分可辨识性

机器学习 2023-06-08 v2 人工智能 机器学习

摘要

为复杂的现实世界任务手动设计奖励函数通常极具挑战。为此,可使用奖励学习从数据中推断奖励函数。然而,即便在无限数据极限下,也常存在多个同样契合数据的奖励函数。这意味着奖励函数仅是部分可辨识的。在本工作中,我们针对若干流行的奖励学习数据源(包括专家演示与轨迹比较)形式化刻画了奖励函数的部分可辨识性。我们还分析了此种部分可辨识性对若干下游任务(如策略优化)的影响。我们在一个通过不变性比较数据源与下游任务的框架中统一了上述结果,并对奖励学习数据源的设计与选择具有启示意义。

关键词

引用

@article{arxiv.2203.07475,
  title  = {Invariance in Policy Optimisation and Partial Identifiability in Reward Learning},
  author = {Joar Skalse and Matthew Farrugia-Roberts and Stuart Russell and Alessandro Abate and Adam Gleave},
  journal= {arXiv preprint arXiv:2203.07475},
  year   = {2023}
}

备注

ICML 2023. 9 pages main paper, 26 pages total, 3 figures