中文

基于最大熵的惩罚奖励强化学习

机器学习 2024-09-16 v1 人工智能 机器人学

摘要

本文引入“软深度最大疼痛”(softDMP)算法,将长期策略熵优化融入惩罚奖励强化学习目标中。其动机是实现动作值更新中算子(operator)的平滑变动,超越传统“max”与“min”算子,以提升样本效率与鲁棒性。我们也解决前一方法的两个未决问题:其一,探究否定(即“翻转”)疼痛寻求子策略——由惩罚动作值导出——如何与“min”算子协同有效学习惩罚模块,以及softDMP的平滑学习算子对“翻转”技巧提供的见解;其二,针对“翻转”子策略(疼痛规避子策略)在统一行为策略中导致的数据收集不一致性,提出一种基于疼痛寻求子策略与目标到达子策略比例的概率分类器,将roll-out分配至独立的回放缓冲区,用于分别更新奖励与惩罚动作价函数。该框架在Turtlebot 3的迷宫导航任务中展现出优异性能。

关键词

引用

@article{arxiv.2405.11784,
  title  = {Reward-Punishment Reinforcement Learning with Maximum Entropy},
  author = {Jiexin Wang and Eiji Uchibe},
  journal= {arXiv preprint arXiv:2405.11784},
  year   = {2024}
}

备注

IJCNN2024