滚动时域逆强化学习
机器学习
2022-10-18 v2 人工智能
摘要
逆强化学习(IRL)旨在推断能够解释专家示范背后目标与偏好的代价函数。本文提出滚动时域逆强化学习(RHIRL),一种面向高维、噪声、连续且具黑盒动态模型系统的新型 IRL 算法。RHIRL 解决了 IRL 的两个关键挑战:可扩展性与鲁棒性。为处理高维连续系统,RHIRL 以滚动时域方式在局部将所诱导的最优轨迹与专家示范匹配,并将局部解“拼接”以学习代价,从而规避“维数灾难”。这与早期在整个高维状态空间上全局匹配专家示范的算法形成鲜明对比。为对不完美的专家示范与控制噪声保持鲁棒,RHIRL 在温和条件下学习一个与系统动态“解耦”的状态相关代价函数。在基准任务上的实验表明,RHIRL 在大多数情况下优于若干主流 IRL 算法。我们还证明了 RHIRL 的累积误差随任务时长线性增长。
引用
@article{arxiv.2206.04477,
title = {Receding Horizon Inverse Reinforcement Learning},
author = {Yiqing Xu and Wei Gao and David Hsu},
journal= {arXiv preprint arXiv:2206.04477},
year = {2022}
}
备注
The paper is accepted by Conference on Neural Information Processing Systems (NeurIPS) 2022