中文

置信度感知逆约束强化学习

机器学习 2024-06-25 v1

摘要

在解决现实世界问题时,人类会隐式遵循那些过于繁杂难以完整指定的约束。然而,强化学习(RL)代理需要这些约束才能在此类设置下学习正确的 optimal 策略。逆约束强化学习(ICRL)领域处理这一问题,并提供算法以从收集的离线专家演示中估计这些约束。实践者更愿意了解这些估计约束的置信度水平,在决定是否使用这些约束之前,这样他们仅使用满足所需置信度水平的约束。然而,先前的方法不允许用户为推断出的约束指定所需的置信度水平。本工作提供一种原则性的 ICRL 方法,可接受置信度水平和一组专家演示,输出至少在所需置信度水平下具有相同约束性的约束。此外,与先前方法不同,本方法允许用户确定专家轨迹数量是否不足以以所需置信度水平学习约束,从而收集更多专家轨迹,以同时学习满足所需置信度水平的约束和实现所需性能的政策。

关键词

引用

@article{arxiv.2406.16782,
  title  = {Confidence Aware Inverse Constrained Reinforcement Learning},
  author = {Sriram Ganapathi Subramanian and Guiliang Liu and Mohammed Elmahgiubi and Kasra Rezaee and Pascal Poupart},
  journal= {arXiv preprint arXiv:2406.16782},
  year   = {2024}
}

备注

Paper to appear in ICML 2024