通过平滑代价与平滑策略实现平滑模仿学习
机器学习
2021-11-04 v1 人工智能
摘要
模仿学习(IL)在连续控制场景中是一种流行的方法,除其他原因外,它规避了强化学习(RL)中奖励误设定与探索的问题。在基于演示的IL中,一个重要挑战是获得相对于输入平滑的智能体策略。通过模仿学习一个作为大型状态-动作(-)空间(高维连续控制环境的典型特征)函数而平滑的策略可能是困难的。我们通过在对抗性模仿学习的策略模型和代价模型上同时使用平滑诱导正则化项,向解决该问题迈出第一步。我们的正则化项通过确保代价函数作为-空间的函数以受控方式变化、且智能体策略相对于状态空间表现良好来发挥作用。我们将这一新的平滑IL算法称为\textit{平滑策略与代价模仿学习}(SPaCIL,发音为'Special')。我们引入一种新度量来量化所学策略的平滑性。我们在来自MuJoCo的连续控制任务上展示了SPaCIL的优越性能。该算法不仅在我们提出的平滑性度量上优于最先进的IL算法,还享有学习更快和平均回报显著更高的额外好处。
引用
@article{arxiv.2111.02354,
title = {Smooth Imitation Learning via Smooth Costs and Smooth Policies},
author = {Sapana Chaudhary and Balaraman Ravindran},
journal= {arXiv preprint arXiv:2111.02354},
year = {2021}
}
备注
To appear in the Proceedings of the Fifth Joint International Conference on Data Science and Management of Data (CoDS-COMAD 2022). Research Track. ACM DL