强化学习中用于安全探索的可迁移领域先验学习
人工智能
2020-09-15 v5
摘要
预先获取领域知识可显著提升强化学习智能体的性能。特别地,它可帮助智能体避免潜在的灾难性探索动作,否则这些动作需在训练中亲身经历。本工作中,我们在一组已学习任务中识别出持续不可取的动作,并利用与之相关的伪奖励学习先验策略。除使该领域后续任务中的探索行为更安全外,我们表明这些先验可迁移至相似环境,且能以离策略方式与该领域中其他任务的学习并行进行。我们在离散与连续环境中将本方法与已有的state-of-the-art算法比较,证明其在学习执行领域中任意任务时表现出更安全的探索行为。我们还给出理论分析以支持这些结果,并简要讨论该方法的启示及一些替代表述,后者在特定场景下亦有用。
引用
@article{arxiv.1909.04307,
title = {Learning Transferable Domain Priors for Safe Exploration in Reinforcement Learning},
author = {Thommen George Karimpanal and Santu Rana and Sunil Gupta and Truyen Tran and Svetha Venkatesh},
journal= {arXiv preprint arXiv:1909.04307},
year = {2020}
}
备注
IJCNN, 2020 (To appear)