中文

离策略数据下机器人终身学习中的遗忘与不平衡问题

机器人学 2022-08-19 v2 人工智能 机器学习

摘要

机器人在其整个生命周期中会经历非平稳的环境动态:机器人动态可能因磨损而改变,或其周围环境可能随时间变化。最终,机器人应在其遇到的所有环境变化中表现良好。同时,它仍应能在新环境中快速学习。我们指出了在这种带离策略数据的终身学习设定下强化学习 (RL) 的两个挑战:首先,尽管在回放缓冲区中保留了所有数据,现有的离策略算法仍难以在保持旧环境中良好表现的保守性与在新环境中高效学习之间取得权衡。我们提出离线蒸馏流水线,通过将训练过程分离为在线交互阶段和离线蒸馏阶段来打破这一权衡。其次,我们发现使用生命周期中来自多个环境的不平衡离策略数据进行训练会造成显著的性能下降。我们确定这一性能下降是由各数据集之间质量和规模的不平衡共同加剧了 Q 函数的外推误差所致。在蒸馏阶段,我们通过对策将策略保持更接近生成数据的行为策略来简单修复该问题。在实验中,我们通过一个模拟双足机器人行走任务在各种环境变化下展示了这两个挑战及所提出的解决方案。我们表明离线蒸馏流水线在不影响数据收集的情况下于所有遇到的环境中实现了更好的性能。我们还提供了全面的实证研究以支持我们关于数据不平衡问题的假设。

关键词

引用

@article{arxiv.2204.05893,
  title  = {Forgetting and Imbalance in Robot Lifelong Learning with Off-policy Data},
  author = {Wenxuan Zhou and Steven Bohez and Jan Humplik and Abbas Abdolmaleki and Dushyant Rao and Markus Wulfmeier and Tuomas Haarnoja and Nicolas Heess},
  journal= {arXiv preprint arXiv:2204.05893},
  year   = {2022}
}

备注

Published at 1st Conference on Lifelong Learning Agents, 2022