面向随机环境的分层模仿学习
机器学习
2023-09-26 v1 机器人学
摘要
模仿学习的许多应用要求智能体生成训练数据中观察到的行为的完整分布。例如,为了在仿真中评估自动驾驶车辆的安全性,对其他道路使用者准确且多样的行为模型至关重要。现有提升这种分布真实性的方法通常依赖于分层策略。这些方法将策略条件化于诸如目标或人物类型等类型上,从而产生多模态行为。然而,此类方法往往不适用于智能体还必须对外部因素作出反应的随机环境:由于在训练期间智能体类型是从观察到的未来轨迹推断出来的,这些环境要求将内部因素与外部因素对智能体行为的贡献解耦,并且仅有内部因素(即处于智能体控制之下的因素)被编码进类型中。对外部因素的未来信息进行编码会导致在测试期间出现不恰当的智能体反应,因为此时未来未知且类型必须与真实未来独立地抽取。我们将这一挑战形式化为在环境随机性下智能体类型条件分布中的分布偏移。我们提出鲁棒类型条件化(Robust Type Conditioning, RTC),它通过随机采样类型下的对抗训练消除该偏移。在两个领域(包括大规模的 Waymo Open Motion Dataset)上的实验表明,与最先进的基线相比,在保持或提升任务性能的同时,分布真实性得到了改善。
引用
@article{arxiv.2309.14003,
title = {Hierarchical Imitation Learning for Stochastic Environments},
author = {Maximilian Igl and Punit Shah and Paul Mougin and Sirish Srinivasan and Tarun Gupta and Brandyn White and Kyriacos Shiarlis and Shimon Whiteson},
journal= {arXiv preprint arXiv:2309.14003},
year = {2023}
}
备注
Published at IROS'23