GO-DICE:基于平稳分布校正估计的目标条件选项感知离线模仿学习
机器学习
2023-12-19 v1 人工智能
摘要
离线模仿学习~(IL) 是指仅从演示中学习专家行为,而无需与环境进行任何额外交互。尽管离线 IL 取得了重大进展,但现有技术在为长时程任务学习策略方面仍面临挑战,并且在任务规范改变时需要大量重新训练。为了解决这些局限性,我们提出了 GO-DICE,一种用于目标条件长时程序列任务的离线 IL 技术。GO-DICE 从演示中识别子任务层次,并利用它们分别学习用于子任务转换和动作执行的独立策略;这种分层策略学习促进了长时程推理。受庞大的 DICE 系列技术启发,两个层级的策略学习均在平稳分布空间内进行。此外,两种策略均以目标条件方式学习,以在任务目标改变时最小化重新训练的需求。实验结果证实,GO-DICE 优于近期的基线方法,在难度逐渐增加的 Mujoco 机器人拾取与放置任务中完成率的显著改善即为证据。GO-DICE 还能够在可用时利用不完美的演示和部分任务分割,两者均能提升相对于仅从专家演示中学习的任务性能。
引用
@article{arxiv.2312.10802,
title = {GO-DICE: Goal-Conditioned Option-Aware Offline Imitation Learning via Stationary Distribution Correction Estimation},
author = {Abhinav Jain and Vaibhav Unhelkar},
journal= {arXiv preprint arXiv:2312.10802},
year = {2023}
}
备注
Extended version of an identically-titled paper accepted at AAAI 2024