中文

基于双结构的跨域模仿学习

机器学习 2020-09-28 v3 机器学习

摘要

本文考虑跨域模仿学习(CDIL),其中目标域中的智能体通过观测源域中的专家示范(不访问任何奖励函数)来学习在目标域中表现良好的策略。为克服模仿学习的域差异,我们提出一种双结构学习方法。该学习方法从每个输入观测中提取两个特征向量,其中一个向量包含域信息,另一个向量包含策略专业性信息,随后通过合成同时包含目标域与策略专业性信息的新特征向量来增强特征向量。所提出的CDIL方法在若干MuJoCo任务上进行了测试,其中域差异由图像角度或颜色决定。数值结果表明,所提方法在CDIL上优于其他现有算法,并达到了与无域差异模仿学习几乎相同的性能。

关键词

引用

@article{arxiv.2006.01494,
  title  = {Cross-Domain Imitation Learning with a Dual Structure},
  author = {Sungho Choi and Seungyul Han and Woojun Kim and Youngchul Sung},
  journal= {arXiv preprint arXiv:2006.01494},
  year   = {2020}
}

备注

Some errors are identified in the experiment