基于案例推理在 OpenAI 中实现行为克隆
人工智能
2020-02-27 v1 机器学习
摘要
从观察中学习(Learning from Observation,LfO),又称行为克隆(Behavioral Cloning),是一种通过记录专家(人类或人工智能)的行为并利用所记录数据生成所需行为来构建软件智能体的方法。jLOAF 是一个使用案例推理(Case-Based Reasoning)实现 LfO 的平台。在本文中,我们将 jLOAF 与流行的 OpenAI Gym 环境进行接口对接。我们的实验结果表明,我们的方法如何可用于在该领域中提供比较基线,并识别在处理环境复杂性时的优势与不足。
引用
@article{arxiv.2002.11197,
title = {Behavior Cloning in OpenAI using Case Based Reasoning},
author = {Chad Peters and Babak Esfandiari and Mohamad Zalat and Robert West},
journal= {arXiv preprint arXiv:2002.11197},
year = {2020}
}