用于模仿学习的域对抗条件状态空间模型
机器学习
2021-06-07 v2 人工智能
机器人学
机器学习
摘要
部分可观测马尔可夫决策过程中的状态表示学习(SRL)已被研究用于学习对机器人控制任务有用的数据抽象特征。对于 SRL,获取域无关状态对于实现高效的模仿学习至关重要。若无这些状态,模仿学习会受到对控制无用的域依赖信息的阻碍。然而,当专家与智能体的数据呈现较大域偏移时,现有方法无法从状态中去除此类干扰。为克服该问题,我们提出域对抗与条件状态空间模型(DAC-SSM),使控制系统能够获得域无关且感知任务与动力学的状态。DAC-SSM 联合优化状态推断、观测重构、前向动力学与奖励模型。为从状态中去除域依赖信息,该模型以对抗方式用域判别器训练,且重构以域标签为条件。我们在模拟器中通过稀疏奖励任务连续控制的模仿学习实验评估了模型预测控制性能,并与现有 SRL 方法的性能比较。DAC-SSM 的智能体达到了与专家相当的性能,且超过基线两倍以上。我们得出结论:域无关状态对于存在较大域偏移的模仿学习至关重要,且可利用 DAC-SSM 获得。
引用
@article{arxiv.2001.11628,
title = {Domain-Adversarial and Conditional State Space Model for Imitation Learning},
author = {Ryo Okumura and Masashi Okada and Tadahiro Taniguchi},
journal= {arXiv preprint arXiv:2001.11628},
year = {2021}
}
备注
Published at IROS 2020