中文

面向非累积目标的强化学习

机器学习 2024-04-15 v2 人工智能 网络与互联网体系结构 最优化与控制 机器学习

摘要

在强化学习中,目标几乎总是定义为过程中奖励的某种\emph{累积}函数。然而,在诸多应用领域(尤其是通信与网络中)存在许多最优控制与强化学习问题,其目标并非自然地表达为奖励之和。本文认识到非累积目标在各种问题中的普遍性,并提出对现有算法进行修改以优化此类目标。具体而言,我们深入探究许多最优控制与强化学习算法的基石:Bellman 最优方程。为优化非累积目标,我们将 Bellman 更新规则中原有的求和运算替换为对应于该目标的广义运算。此外,我们给出了广义运算形式的充分条件,以及对马尔可夫决策过程的假设,在此之下可保证广义 Bellman 更新的全局最优收敛。我们以瓶颈目标(即由过程中最小奖励决定的目标)在经典最优控制与强化学习任务,以及两个最大化流率的网络路由问题上进行了实验演示。

关键词

引用

@article{arxiv.2307.04957,
  title  = {Reinforcement Learning with Non-Cumulative Objective},
  author = {Wei Cui and Wei Yu},
  journal= {arXiv preprint arXiv:2307.04957},
  year   = {2024}
}

备注

13 pages, 6 figures. Published in IEEE Transactions on Machine Learning in Communications and Networking (TMLCN)