RICE:突破强化学习训练瓶颈的解释方法
机器学习
2024-06-07 v3 人工智能
密码学与安全
摘要
深度强化学习 (DRL) 正在发挥越来越重要的作用,在实际应用中发挥着关键作用。然而,对于复杂任务,尤其是稀疏奖励任务,获取表现优化的 DRL 智能体,仍然是一个显著的挑战。DRL 智能体的训练过程可能会被卡在某个瓶颈中,无法继续进展。本文提出了 RICE,这是一种创新的强化学习细化方案,融合了解释方法以突破训练瓶颈。RICE 的核心思想是构建一种新的初始状态分布,将默认的初始状态与通过解释方法识别的关键状态相结合,从而鼓励智能体从混合初始状态进行探索。通过仔细设计,我们能够理论上保证该细化方案具有更紧的次优界。我们在各种流行的强化学习环境和实际应用中评估了 RICE。结果表明,RICE 在提升智能体性能方面显著优于现有的细化方案。
引用
@article{arxiv.2405.03064,
title = {RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation},
author = {Zelei Cheng and Xian Wu and Jiahao Yu and Sabrina Yang and Gang Wang and Xinyu Xing},
journal= {arXiv preprint arXiv:2405.03064},
year = {2024}
}
备注
Accepted by ICML 2024