抽象演示与自适应探索用于高效稳定的多步稀疏奖励强化学习
机器人学
2023-03-10 v1 人工智能
机器学习
摘要
尽管深度强化学习 (DRL) 已在包括机器人在内的许多学科中流行,但最先进的 DRL 算法仍难以学习长时序、多步且稀疏奖励的任务,例如仅给定任务完成奖励信号来堆叠数个方块。为提高此类任务的学习效率,本文提出一种 DRL 探索技术,称为 A^2,它集成了受人类经验启发的两部分:抽象演示与自适应探索。A^2 首先将复杂任务分解为子任务,然后提供待学习的正确子任务顺序。在训练期间,智能体自适应地探索环境,对已熟练掌握的子任务更确定性地行动,对未学好的子任务更随机地行动。我们在若干网格世界任务和三个机器人操作任务上进行了消融与对比实验。我们证明 A^2 能够帮助流行的 DRL 算法 (DQN、DDPG 和 SAC) 在这些环境中更高效且稳定地学习。
引用
@article{arxiv.2207.09243,
title = {Abstract Demonstrations and Adaptive Exploration for Efficient and Stable Multi-step Sparse Reward Reinforcement Learning},
author = {Xintong Yang and Ze Ji and Jing Wu and Yu-kun Lai},
journal= {arXiv preprint arXiv:2207.09243},
year = {2023}
}
备注
Accepted by The 27th IEEE International Conference on Automation and Computing (ICAC2022)