中文

LiMIIRL:轻量级多意图逆强化学习

机器学习 2021-06-04 v1 人工智能 机器人学

摘要

多意图逆强化学习(MI-IRL)旨在寻找一个奖励函数集成,以解释不同但未被标注意图的示范数据。在用于学习概率性 MI-IRL 模型的流行期望最大化(EM)框架内,我们提出了一种基于示范数据在特征空间中预先聚类的热启动策略。我们的理论分析表明,若行为模式满足温和的分离条件,该热启动解可产生近最优的奖励集成。我们还提出了一种 MI-IRL 性能度量,它将流行的期望价值差异度量推广为直接依据真实奖励集成评估所学奖励。我们的度量通过最小成本流公式优雅地解决了所学奖励与真实奖励配对困难的问题,且计算高效。我们还构建了一个 MI-IRL 基准问题,以支持更全面的算法评估。在该问题上,我们发现 MI-IRL 热启动策略有助于避免低质量局部极小奖励集成,从而显著改善行为聚类。我们广泛的敏感性分析表明,在各种设置下(包括理论假设未必成立的情形)所学奖励集成的质量均得到提升。最后,我们通过在大型真实世界驾驶员 GPS 轨迹数据集中发现不同驾驶风格,证明了方法的有效性。

关键词

引用

@article{arxiv.2106.01777,
  title  = {LiMIIRL: Lightweight Multiple-Intent Inverse Reinforcement Learning},
  author = {Aaron J. Snoswell and Surya P. N. Singh and Nan Ye},
  journal= {arXiv preprint arXiv:2106.01777},
  year   = {2021}
}

备注

Under review for NeurIPS 2021