CEIL:广义上下文模仿学习
机器学习
2023-10-27 v2
摘要
本文提出\textbf{C}ont\textbf{E}xtual \textbf{I}mitation \textbf{L}earning~(CEIL),一种通用且广泛适用的模仿学习(IL)算法。受后见之明信息匹配公式的启发,我们通过显式学习后见嵌入函数以及使用该嵌入的上下文策略来推导CEIL。为实现IL的专家匹配目标,我们主张优化一个上下文变量,使其将上下文策略偏向模仿专家行为。除典型的从演示学习(LfD)设定外,CEIL是一个通用模型,可有效应用于多种设定,包括:1)从观测学习(LfO),2)离线IL,3)跨域IL(不匹配专家),以及4)一次性IL设定。在实验上,我们在流行的MuJoCo任务(在线)与D4RL数据集(离线)上评估CEIL。与先前最先进的基线相比,我们表明CEIL在大多数在线IL任务中更具样本效率,并在离线任务中取得更优或具竞争力的性能。
引用
@article{arxiv.2306.14534,
title = {CEIL: Generalized Contextual Imitation Learning},
author = {Jinxin Liu and Li He and Yachen Kang and Zifeng Zhuang and Donglin Wang and Huazhe Xu},
journal= {arXiv preprint arXiv:2306.14534},
year = {2023}
}
备注
NeurIPS 2023