基于完全行为克隆的样本高效策略学习
机器学习
2018-11-12 v1 人工智能
系统与控制
摘要
直接策略搜索是强化学习中最重要的算法之一。然而,从零开始学习需要大量经验数据,且容易陷入不良的局部最优。此外,部分训练的策略往往会对智能体与环境执行危险动作。为克服这些挑战,本文提出一种称为基于完全行为克隆的策略学习(PLCBC)的策略初始化算法。PLCBC 首先利用多参数规划将模型预测控制(MPC)控制器转化为分段仿射(PWA)函数,并使用神经网络表达该函数。借此,PLCBC 可在无任何性能损失的情况下完全克隆 MPC 控制器,且完全无需训练。实验表明,该初始化策略可帮助智能体在高回报状态区域学习,并更快且更好地收敛。
引用
@article{arxiv.1811.03853,
title = {Sample-Efficient Policy Learning based on Completely Behavior Cloning},
author = {Qiming Zou and Ling Wang and Ke Lu and Yu Li},
journal= {arXiv preprint arXiv:1811.03853},
year = {2018}
}