基于最大熵的惩罚奖励强化学习
机器学习
2024-09-16 v1 人工智能
机器人学
摘要
本文引入“软深度最大疼痛”(softDMP)算法,将长期策略熵优化融入惩罚奖励强化学习目标中。其动机是实现动作值更新中算子(operator)的平滑变动,超越传统“max”与“min”算子,以提升样本效率与鲁棒性。我们也解决前一方法的两个未决问题:其一,探究否定(即“翻转”)疼痛寻求子策略——由惩罚动作值导出——如何与“min”算子协同有效学习惩罚模块,以及softDMP的平滑学习算子对“翻转”技巧提供的见解;其二,针对“翻转”子策略(疼痛规避子策略)在统一行为策略中导致的数据收集不一致性,提出一种基于疼痛寻求子策略与目标到达子策略比例的概率分类器,将roll-out分配至独立的回放缓冲区,用于分别更新奖励与惩罚动作价函数。该框架在Turtlebot 3的迷宫导航任务中展现出优异性能。
关键词
引用
@article{arxiv.2405.11784,
title = {Reward-Punishment Reinforcement Learning with Maximum Entropy},
author = {Jiexin Wang and Eiji Uchibe},
journal= {arXiv preprint arXiv:2405.11784},
year = {2024}
}
备注
IJCNN2024