用于可泛化策略的不变因果模仿学习
机器学习
2023-11-06 v1 机器学习
摘要
考虑基于来自多个环境的演示行为学习一个模仿策略,以期部署于未见过的环境中。由于每个环境的可观测特征可能不同,直接将各个策略学习为从特征到动作的映射容易受虚假相关的影响——并且可能泛化不佳。然而,专家的策略通常是那些可观测特征背后共享的潜在结构的函数,该结构在不同环境间是不变的。通过利用来自多个环境的数据,我们提出了不变因果模仿学习(Invariant Causal Imitation Learning, ICIL),这是一种新技术,在其中我们学习一个跨域不变的表征,并基于此学习一个匹配专家行为的模仿策略。为应对转移动态不匹配,ICIL 学习因果特征的共享表征(针对所有训练环境),其与噪声变量(针对每个训练环境)的特定表征解耦。此外,为确保所学策略匹配专家策略的观测分布,ICIL 估计专家观测的能量,并使用一个正则化项来最小化模仿者策略的下一状态能量。在实验上,我们在控制和医疗任务中将我们的方法与若干基准进行比较,并展示了其在学习能够泛化到未见环境的模仿策略上的有效性。
引用
@article{arxiv.2311.01489,
title = {Invariant Causal Imitation Learning for Generalizable Policies},
author = {Ioana Bica and Daniel Jarrett and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2311.01489},
year = {2023}
}