中文

面向多目标强化学习的 Pareto 稳态探索:基于多目标加权 Chebyshev Actor-Critic 方法

量子物理 2026-01-15 v1

摘要

在许多多目标强化学习(MORL)应用中,能够在多个非凸奖励目标下系统性地探索 Pareto 稳态解并具备理论有限时间样本复杂度保证是一个重要且尚未被充分探索的问题。这促使我们着手填补 MORL 中的重要空白。具体而言,本文提出了一种名为 MOCHA(Multi-Objective weighted-CHebyhev Actor-critic)的算法,用于 MORL,仔细地将加权 Chebyshev(WC)和 actor-critic 框架集成,以实现具有有限时间样本复杂度保证的系统性 Pareto 稳态探索。MOCHA 算法的样本复杂度结果揭示了在寻找 ϵ\epsilon-Pareto 稳态解时对 pminp_{\min} 的依赖问题,其中 pminp_{\min} 表示 WC 标量化中给定权重向量 p\mathbf{p} 的最小元素。通过仔细选择学习率,每个探索的样本复杂度可达 O~(ϵ2)\tilde{\mathcal{O}}(\epsilon^{-2})。此外,基于大型 KuaiRand 离线数据集的仿真研究表明,MOCHA 算法的性能显著优于其他基准 MORL 方法。

关键词

引用

@article{arxiv.2507.21396,
  title  = {Towards self-correcting quantum codes for neutral atom arrays},
  author = {Jinkang Guo and Yifan Hong and Adam Kaufman and Andrew Lucas},
  journal= {arXiv preprint arXiv:2507.21396},
  year   = {2026}
}

备注

29 pages, 9 figures, 2 tables