中文

强化学习中基于动力学感知奖励的无监督域适应

机器学习 2021-10-27 v2

摘要

无监督强化学习旨在无需先验目标表示即可获取技能,其中智能体自动探索开放式环境以表示目标并学习目标条件策略。然而,该过程通常耗时较长,限制了在某些可能代价高昂的目标环境中的展开。在另一交互丰富的环境中训练的直观方法会因动力学偏移破坏已学技能在目标环境中的可复现性,从而阻碍直接迁移。假设可免费访问源环境,我们提出一种无监督域适应方法,以跨动力学识别并获取技能。特别地,我们引入 KL 正则化目标以鼓励技能涌现,在发现技能以及使行为对齐动力学偏移时均给予智能体奖励。这表明源与目标两种动力学共同塑造奖励,以促进自适应技能的学习。我们还进行了实证实验,证明该方法能有效学习可平滑部署于目标环境的技能。

关键词

引用

@article{arxiv.2110.12997,
  title  = {Unsupervised Domain Adaptation with Dynamics-Aware Rewards in Reinforcement Learning},
  author = {Jinxin Liu and Hao Shen and Donglin Wang and Yachen Kang and Qiangxing Tian},
  journal= {arXiv preprint arXiv:2110.12997},
  year   = {2021}
}

备注

Accepted by NeurIPS 2021