用于快速且安全策略改进的多样性探索
机器学习
2018-02-26 v1
摘要
我们研究在线强化学习域中一个重要却未被充分解决的问题:快速且安全地改进策略。作为其解决方案,我们提出一种新颖探索策略——多样性探索(DE),其学习并部署一组多样的安全策略以探索环境。我们提供 DE 理论,解释为何行为策略的多样性能够在不牺牲利用的前提下实现有效探索。我们的实证研究表明,实现 DE 策略的在线策略改进算法框架可同时实现快速策略改进与安全的在线性能。
引用
@article{arxiv.1802.08331,
title = {Diverse Exploration for Fast and Safe Policy Improvement},
author = {Andrew Cohen and Lei Yu and Robert Wright},
journal= {arXiv preprint arXiv:1802.08331},
year = {2018}
}
备注
AAAI18