中文

通过捕获表示不匹配进行跨域策略适应

机器学习 2024-05-27 v1 人工智能

摘要

在强化学习(RL)中,学习能够迁移到具有动力学差异的不同域的有效策略至关重要。在本文中,我们考虑动力学适应设置,其中源域和目标域之间存在动力学不匹配,并且可以访问充足的源域数据,但只能与目标域进行有限的交互。现有方法通过学习域分类器、从值差异角度进行数据过滤等来解决此问题。相反,我们从解耦表示学习的角度应对这一挑战。我们仅在目标域中进行表示学习,并测量源域转移上的表示偏差,我们证明这可以是动力学不匹配的信号。我们还表明,表示偏差上界了给定策略在源域和目标域中的性能差异,这激励我们将表示偏差用作奖励惩罚。产生的表示不参与策略或值函数,而仅作为奖励惩罚器。我们在具有运动学和形态学不匹配的环境上进行了大量实验,结果表明我们的方法在许多任务上表现出强大的性能。我们的代码公开于 https://github.com/dmksjfl/PAR。

关键词

引用

@article{arxiv.2405.15369,
  title  = {Cross-Domain Policy Adaptation by Capturing Representation Mismatch},
  author = {Jiafei Lyu and Chenjia Bai and Jingwen Yang and Zongqing Lu and Xiu Li},
  journal= {arXiv preprint arXiv:2405.15369},
  year   = {2024}
}

备注

ICML 2024