DEALIO:用于观测模仿的数据高效对抗学习
机器学习
2021-04-02 v1 人工智能
摘要
在观测模仿学习(IfO)中,学习智能体仅利用所演示行为的观测数据来模仿演示智能体,而无法访问演示者生成的控制信号。近期基于对抗模仿学习的方法在 IfO 问题上取得了最先进的性能,但由于依赖数据效率低下的无模型强化学习算法,它们通常存在样本复杂度高的问题。这一问题使得它们难以在实际场景中部署,因为收集样本可能在时间、能量和风险方面产生高昂代价。在本工作中,我们假设可以将基于模型的强化学习思想与对抗方法相结合用于 IfO,从而在不牺牲性能的前提下提高这些方法的数据效率。具体而言,我们考虑时变线性高斯策略,并提出一种将线性二次型调节器与路径积分策略改进整合进现有对抗 IfO 框架的方法。由此得到一种数据效率更高且性能更优的 IfO 算法,我们在四个仿真域中通过实验证明:使用远少于现有方法与环境的交互次数,所提方法表现出相似或更好的性能。
引用
@article{arxiv.2104.00163,
title = {DEALIO: Data-Efficient Adversarial Learning for Imitation from Observation},
author = {Faraz Torabi and Garrett Warnell and Peter Stone},
journal= {arXiv preprint arXiv:2104.00163},
year = {2021}
}