中文

通过从经验中学习改进从演示中学习

人工智能 2021-11-17 v1

摘要

当演示相对有限时,如何使模仿学习更具泛化性一直是强化学习(RL)中的持久问题。糟糕的演示导致狭窄且有偏的数据分布,非马尔可夫的人类专家演示使智能体难以学习,而对次优轨迹的过度依赖会让智能体难以提升性能。为解决这些问题,我们提出一种名为 TD3fG 的新算法,可平滑地从向专家学习过渡到向经验学习。我们的算法在具有有限且次优演示的 MUJOCO 环境中取得良好性能。我们使用行为克隆训练网络作为参考动作生成器,并在损失函数与探索噪声两方面加以利用。该创新可帮助智能体从演示中提取先验知识,同时减轻演示不良马尔可夫性质的有害影响。与 BC+ 微调和 DDPGfD 方法相比,它尤其在演示相对有限时表现更优。我们将方法称为 TD3fG,意为来自生成器的 TD3。

关键词

引用

@article{arxiv.2111.08156,
  title  = {Improving Learning from Demonstrations by Learning from Experience},
  author = {Haofeng Liu and Yiwen Chen and Jiayi Tan and Marcelo H Ang},
  journal= {arXiv preprint arXiv:2111.08156},
  year   = {2021}
}