中文

面向连续动作弱耦合马尔可夫决策过程的深度强化学习

机器学习 2024-06-13 v2 人工智能 多智能体系统

摘要

本文介绍了连续动作拉格朗日策略(LPCA),一种专为具有连续动作空间的弱耦合 MDP 问题设计的强化学习算法。LPCA 通过在用于 Q 值计算的神经网络框架中引入弱耦合 MDP 问题的拉格朗日松弛,解决了依赖于连续动作的资源约束挑战。该方法有效地解耦了 MDP,从而在资源受限环境中实现高效策略学习。我们提出了 LPCA 的两种变体:LPCA-DE,利用差分进化进行全局优化;以及 LPCA-Greedy,一种基于 Q 值梯度逐步贪心选择动作的方法。与各种设置下的其他最先进技术的比较分析凸显了 LPCA 在管理资源分配同时最大化奖励方面的鲁棒性和效率。

关键词

引用

@article{arxiv.2406.01099,
  title  = {Deep reinforcement learning for weakly coupled MDP's with continuous actions},
  author = {Francisco Robledo and Urtzi Ayesta and Konstantin Avrachenkov},
  journal= {arXiv preprint arXiv:2406.01099},
  year   = {2024}
}

备注

ACM SIGMETRICS / ASMTA 2024, Jun 2024, Venise, Italy