中文

从纠正性人类反馈中学习高斯策略

机器学习 2019-03-14 v1 机器学习

摘要

从人类反馈中学习是一种无需建模或控制专业知识的控制设计可行替代方案。特别是,从纠正性建议中学习相比评价性反馈具有优势,因为其是一种更直观且可扩展的形式。该领域当前的最先进技术COACH已被证明是处理受限问题的有效方法。然而,它使用径向基函数网络参数化策略,这对于高阶系统需要精细的特征空间工程。我们提出高斯过程教练(GPC),通过采用高斯过程避免了特征空间工程。此外,我们利用可用的策略不确定性来1)询问具有最大效用的反馈样本,以及2)将学习率适应于教师的教导阶段。我们证明,该新算法在OpenAI Gym连续控制基准中,无论是模拟还是真实人类教师,在最终性能、收敛速度和对错误反馈的鲁棒性方面均优于当前最先进技术。

关键词

引用

@article{arxiv.1903.05216,
  title  = {Learning Gaussian Policies from Corrective Human Feedback},
  author = {Daan Wout and Jan Scholten and Carlos Celemin and Jens Kober},
  journal= {arXiv preprint arXiv:1903.05216},
  year   = {2019}
}

备注

Submitted to the Uncertainty in Artificial Intelligence (UAI) Conference of 2019