ABC:面向离线寻模模仿学习的对抗行为克隆
机器学习
2022-11-09 v1 人工智能
摘要
给定一组专家智能体与环境交互的数据集,提取有效智能体策略的一种可行方法是估计该数据所指示的最大似然策略。这种方法通常被称为行为克隆(BC)。在本工作中,我们描述了由于最大似然目标函数而导致 BC 的一个关键缺陷;即当学习者的策略用高斯分布表示时,BC 相对于状态条件专家动作分布是均值寻求的。为解决此问题,我们引入了 BC 的改进版本——对抗行为克隆(ABC),其通过融入 GAN(生成对抗网络)训练的元素而表现出寻模行为。我们在玩具域以及基于 DeepMind Control 套件中 Hopper 的域上评估了 ABC,并表明其因具有寻模特性而优于标准 BC。
引用
@article{arxiv.2211.04005,
title = {ABC: Adversarial Behavioral Cloning for Offline Mode-Seeking Imitation Learning},
author = {Eddy Hudson and Ishan Durugkar and Garrett Warnell and Peter Stone},
journal= {arXiv preprint arXiv:2211.04005},
year = {2022}
}