中文

通过预测奖励不确定性作为子任务实现的稳定深度强化学习方法

机器学习 2023-10-04 v1 人工智能

摘要

近年来,深度强化学习(DRL)已完成了多种任务。然而,将 DRL 应用于真实世界环境中的任务时,设计恰当的奖励是困难的。通过实际硬件传感器获得的奖励可能包含噪声、误读或观测失败。这些不稳定信号导致的学习不稳定性是 DRL 中尚待解决的问题。本工作中,我们提出一种方法,通过添加直接估计奖励信号中所包含方差的子任务来扩展现有 DRL 模型。该模型随后将子任务在评论家网络中学习到的特征图送入行动者网络。这使得学习能够稳定且对潜在噪声的影响具有鲁棒性。在具有不稳定奖励信号的 Atari 游戏域中的实验结果表明,我们的方法稳定了训练收敛。我们还通过可视化特征图讨论了模型的扩展性。该方法有潜力使 DRL 在含噪的真实世界场景中更具实用性。

关键词

引用

@article{arxiv.2101.06906,
  title  = {Stable deep reinforcement learning method by predicting uncertainty in rewards as a subtask},
  author = {Kanata Suzuki and Tetsuya Ogata},
  journal= {arXiv preprint arXiv:2101.06906},
  year   = {2023}
}

备注

Published as a conference paper at ICONIP 2020