中文

评估固定批量学习任意未来任务中与任务无关的探索

机器学习 2019-11-21 v1 机器人学 机器学习

摘要

深度强化学习已被证明能够解决在可获得大量训练经验(通常在学习任务时在线获取)情况下的挑战性任务。机器人技术是许多此类算法的重要潜在应用领域,但在真实世界中生成机器人经验成本高昂,尤其当每个任务都需要冗长的在线训练过程时。离策略算法原则上可从足够多样的固定数据集中学习任意任务。本工作中,我们通过在真实世界中完全离线学习解决任务而不进行任何进一步交互的目的生成机器人数据集,评估流行的探索方法。我们给出了在仿真中三个流行连续控制任务以及高维真实机器臂连续控制上的结果。记录所有算法、实验和超参数的代码可在 https://github.com/qutrobotlearning/batchlearning 获取。

关键词

引用

@article{arxiv.1911.08666,
  title  = {Evaluating task-agnostic exploration for fixed-batch learning of arbitrary future tasks},
  author = {Vibhavari Dasagi and Robert Lee and Jake Bruce and Jürgen Leitner},
  journal= {arXiv preprint arXiv:1911.08666},
  year   = {2019}
}