策略增强:一种加速深度强化学习算法收敛的探索策略
机器学习
2021-02-11 v1 人工智能
计算机视觉与模式识别
机器人学
系统与控制
系统与控制
摘要
尽管深度强化学习算法取得了进展,开发有效的探索策略仍是一个开放问题。大多数现有探索策略要么基于简单启发式方法,要么需要环境模型,要么训练额外的深度神经网络以生成想象增强路径。本文引入了一种称为策略增强(Policy Augmentation)的新算法。策略增强基于一种新开发的归纳矩阵补全方法。所提算法增强未探索状态-动作对的值,帮助智能体在早期回合中采取能带来高价值回报的动作。使用高价值滚动轨迹训练深度强化学习算法可使其更快收敛。我们的实验展示了策略增强的优越性能。代码见:https://github.com/arashmahyari/PolicyAugmentation。
引用
@article{arxiv.2102.05249,
title = {Policy Augmentation: An Exploration Strategy for Faster Convergence of Deep Reinforcement Learning Algorithms},
author = {Arash Mahyari},
journal= {arXiv preprint arXiv:2102.05249},
year = {2021}
}
备注
proceedings of 46th IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2021