MERL:多头强化学习
机器学习
2020-04-01 v6 人工智能
机器学习
摘要
强化学习中的一个常见挑战是如何将智能体与环境的交互转化为快速且稳健的学习。例如,早期工作利用领域知识在复杂任务中改进现有强化学习算法。虽有前景,但先前获取的知识往往代价高昂且难以扩展。相反,我们决定考虑问题知识,利用与解决任意任务相关的量的信号,例如自我性能评估和准确期望。𝒱^ex 便是这样一个量。它是价值函数 V 所解释的方差比例,衡量 V 与回报之间的偏差。利用 𝒱^ex,我们提出 MERL,一种通过将问题知识注入策略梯度更新来构建强化学习的通用框架。因此,智能体不仅为奖励而优化,还使用 MERL 提供的以问题为核心的量进行学习,可开箱即用地应用于任意任务。本文中:(a) 我们介绍并定义 MERL,即贯穿本工作的多头强化学习框架。(b) 我们在多种标准基准环境上开展实验,包括 9 个连续控制任务,结果显示性能提升。(c) 我们证明 MERL 也能在一组具有挑战性的基于像素的任务上改善迁移学习。(d) 我们思考 MERL 如何解决奖励稀疏问题并更好地调节强化学习智能体的特征空间。
引用
@article{arxiv.1909.11939,
title = {MERL: Multi-Head Reinforcement Learning},
author = {Yannis Flet-Berliac and Philippe Preux},
journal= {arXiv preprint arXiv:1909.11939},
year = {2020}
}
备注
Deep Reinforcement Learning Workshop, NeurIPS 2019