中文

无先验掩码:消除深度强化学习中的冗余动作

机器学习 2023-12-12 v1 人工智能

摘要

庞大的动作空间是将强化学习方法部署到现实世界的一大根本障碍。大量冗余动作会导致智能体进行重复或无效的尝试,甚至引发任务失败。尽管当前算法对此问题做了一些初步探索,但它们要么依赖基于规则的系统,要么依赖专家演示,这极大地限制了它们在许多现实场景中的适用性。本文对策略优化中哪些动作可以被消除进行了理论分析,并提出了一种新颖的冗余动作过滤机制。与其他工作不同,我们的方法通过估计状态分布之间的距离来构建相似性因子,无需任何先验知识。此外,我们结合了改进的逆模型,以避免在高维状态空间中进行大量计算。我们揭示了动作空间的底层结构,并基于上述技术提出了一种简单而高效的冗余动作过滤机制,称为无先验掩码(No Prior Mask,NPM)。我们通过在具有各种动作冗余的高维、像素输入和随机问题上进行大量实验,展示了该方法优越的性能。我们的代码已在 https://github.com/zhongdy15/npm 上公开发布。

关键词

引用

@article{arxiv.2312.06258,
  title  = {No Prior Mask: Eliminate Redundant Action for Deep Reinforcement Learning},
  author = {Dianyu Zhong and Yiqin Yang and Qianchuan Zhao},
  journal= {arXiv preprint arXiv:2312.06258},
  year   = {2023}
}