中文

用于模仿学习的贝叶斯鲁棒优化

机器学习 2024-03-04 v4 机器学习

摘要

模仿学习的主要挑战之一是确定智能体在处于演示的状态分布之外时应采取何种动作。逆强化学习(IRL)可以通过学习参数化的奖励函数来实现对新状态的泛化,但这些方法仍然面临真实奖励函数及相应最优策略的不确定性。现有的基于 IRL 的安全模仿学习方法使用最大最小框架来处理这种不确定性,该框架在假设对抗性奖励函数的情况下优化策略,而风险中性的 IRL 方法则针对均值或最大后验奖励函数优化策略。完全忽略风险可能导致过于激进和不安全的策略,而以完全对抗的方式进行优化也存在问题,因为它可能导致过于保守的策略,在实践中表现不佳。为了在这两个极端之间架起桥梁,我们提出了用于模仿学习的贝叶斯鲁棒优化(BROIL)。BROIL 利用贝叶斯奖励函数推断和用户特定的风险容忍度,高效地优化一个在期望回报和条件风险价值之间取得平衡的鲁棒策略。我们的实证结果表明,BROIL 提供了一种在回报最大化和风险最小化行为之间进行插值的自然方式,并且优于现有的风险敏感和风险中性逆强化学习算法。代码可在 https://github.com/dsbrown1331/broil 获取。

关键词

引用

@article{arxiv.2007.12315,
  title  = {Bayesian Robust Optimization for Imitation Learning},
  author = {Daniel S. Brown and Scott Niekum and Marek Petrik},
  journal= {arXiv preprint arXiv:2007.12315},
  year   = {2024}
}

备注

In proceedings NeurIPS 2020