中文

破解凹形多目标强化学习中的偏差障碍

机器学习 2026-03-10 v1 机器学习

摘要

虽然标准强化学习优化单个奖励信号,但许多应用需要优化对多个目标 f(J1π,,JMπ)f(J_1^\pi,\dots,J_M^\pi) 的非线性效用函数,其中每个 JmπJ_m^\pi 表示不同奖励函数的预期折扣回报。常见方法是凹型标量化,这捕捉了公平性和风险敏感性等重要权衡。然而,非线性标量化对策略梯度方法引入了根本性挑战:梯度依赖于 f(Jπ)\partial f(J^\pi),而实际中仅获得经验回报估计 J^\hat J。由于 ff 为非线性,插值估计器是有偏的 (E[f(J^)]f(E[J^])\mathbb{E}[\partial f(\hat J)] \neq \partial f(\mathbb{E}[\hat J])),导致持续的梯度偏差降低样本复杂度。在本文中,我们在凹型标量化多目标强化学习中识别并克服了这一偏差障碍。我们表明现有的策略梯度方法因受此偏差影响而具有本质上的 O~(ϵ4)\widetilde{\mathcal{O}}(\epsilon^{-4}) 样本复杂度。为解决此问题,我们开发了一个配备多级蒙特卡洛 (MLMC) 估计器的自然策略梯度 (NPG) 算法,该估计器控制标量化梯度的偏差,同时保持低采样成本。我们证明,该方法为计算 ϵ\epsilon-最优策略实现了最优的 O~(ϵ2)\widetilde{\mathcal{O}}(\epsilon^{-2}) 样本复杂度。此外,我们表明当标量化函数为二阶光滑时,一次偏差会自动消除,允许纯粹的 NPG 达到相同的 O~(ϵ2)\widetilde{\mathcal{O}}(\epsilon^{-2}) 速率而无需 MLMC。我们的结果为在策略梯度方法下对凹型多目标强化学习提供了首个最优样本复杂度保证。

关键词

引用

@article{arxiv.2603.08518,
  title  = {Breaking the Bias Barrier in Concave Multi-Objective Reinforcement Learning},
  author = {Swetha Ganesh and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2603.08518},
  year   = {2026}
}