中文

面向模仿学习中因果混淆问题的对象感知正则化

机器学习 2021-10-28 v1 人工智能

摘要

行为克隆已被证明能有效地从专家示范中学习序贯决策策略。然而,行为克隆常受因果混淆问题困扰:策略依赖专家动作的显著效应(因强相关所致)而非我们所期望的成因。本文提出对象感知正则化(OREO),一种以对象感知方式正则化模仿策略的简易技术。我们的核心思想是鼓励策略均匀关注所有语义对象,以防止策略利用与专家动作强相关的干扰变量。为此,我们引入两阶段方法:(a)利用向量量化变分自编码器的离散编码从图像中提取语义对象;(b)将共享同一离散编码的单元随机一起丢弃,即掩蔽语义对象。实验表明,OREO显著提升行为克隆性能,在多种Atari环境与自动驾驶CARLA环境中优于各类其他正则化及基于因果的方法。我们还展示该方法甚至优于以大量环境交互训练的逆强化学习方法。

关键词

引用

@article{arxiv.2110.14118,
  title  = {Object-Aware Regularization for Addressing Causal Confusion in Imitation Learning},
  author = {Jongjin Park and Younggyo Seo and Chang Liu and Li Zhao and Tao Qin and Jinwoo Shin and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2110.14118},
  year   = {2021}
}

备注

NeurIPS 2021. First two authors contributed equally