中文

多目标强化学习的方差降低策略梯度方法

机器学习 2025-08-15 v1 系统与控制 系统与控制 最优化与控制 统计理论 统计理论

摘要

多目标强化学习(MORL)是传统强化学习(RL)的推广,其旨在同时优化多个相互冲突的目标,而不是专注于单一奖励。这一方法对于必须在各种目标之间进行权衡的复杂决策场景至关重要,例如在最大化性能的同时最小化成本。我们考虑的 MORL 问题中,目标通过非线性标量化函数进行组合。与标准 RL 类似,策略梯度方法(PGMs)是处理大规模连续状态-动作空间的最有效方法之一。然而,现有的 MORL PGMs 存在样本效率低下的问题,需要大量数据才能发挥作用。以往的尝试解决这一问题依赖于过于严格的假设,牺牲了 PGMs 在大规模状态-动作空间可扩展性方面的优势。本文通过实施方差降低技术来减少策略梯度的样本复杂度,同时保持一般性假设,解决了样本效率问题。

关键词

引用

@article{arxiv.2508.10608,
  title  = {Variance Reduced Policy Gradient Method for Multi-Objective Reinforcement Learning},
  author = {Davide Guidobene and Lorenzo Benedetti and Diego Arapovic},
  journal= {arXiv preprint arXiv:2508.10608},
  year   = {2025}
}

备注

7 pages, 4 figures