中文

基于案例推理在 OpenAI 中实现行为克隆

人工智能 2020-02-27 v1 机器学习

摘要

从观察中学习(Learning from Observation,LfO),又称行为克隆(Behavioral Cloning),是一种通过记录专家(人类或人工智能)的行为并利用所记录数据生成所需行为来构建软件智能体的方法。jLOAF 是一个使用案例推理(Case-Based Reasoning)实现 LfO 的平台。在本文中,我们将 jLOAF 与流行的 OpenAI Gym 环境进行接口对接。我们的实验结果表明,我们的方法如何可用于在该领域中提供比较基线,并识别在处理环境复杂性时的优势与不足。

关键词

引用

@article{arxiv.2002.11197,
  title  = {Behavior Cloning in OpenAI using Case Based Reasoning},
  author = {Chad Peters and Babak Esfandiari and Mohamad Zalat and Robert West},
  journal= {arXiv preprint arXiv:2002.11197},
  year   = {2020}
}