中文

基于多策略帕累托前跟踪的在线与离线多目标强化学习

机器学习 2025-08-05 v1

摘要

多目标强化学习(MORL)在现实世界中解决多准则决策问题方面发挥着关键作用。多策略(MP)方法广泛用于获取MORL问题的高质量帕累托前近似。然而,传统MP方法仅依赖在线强化学习(RL),并采用包含大量策略 population的进化框架。这可能导致样本效率低下和/或代理-环境交互过载。为了解决这些问题,本文提出一种 novel的多策略帕累托前跟踪(MPFT)框架,无需维护任何策略 population,可同时应用在线和离线MORL算法。proposed MPFT框架包括四个阶段:阶段1近似所有帕累托顶点策略,其目标空间映射落在帕累托前的顶点上。阶段2设计新的帕累托跟踪机制,从每个帕累托顶点策略开始跟踪帕累托前。阶段3识别已跟踪帕累托前中的稀疏区域,并引入新的目标权重调整方法来填充稀疏区域。最后,通过合并阶段2和3中跟踪的所有策略,阶段4近似帕累托前。在七个不同的连续动作机器人控制任务上实施了在线和离线MORL算法,结果表明我们提出的MPFT方法在超体积性能上优于最先进的基准,同时显著减少了代理-环境交互和硬件需求。

关键词

引用

@article{arxiv.2508.02217,
  title  = {Multi-Policy Pareto Front Tracking Based Online and Offline Multi-Objective Reinforcement Learning},
  author = {Zeyu Zhao and Yueling Che and Kaichen Liu and Jian Li and Junmei Yao},
  journal= {arXiv preprint arXiv:2508.02217},
  year   = {2025}
}

备注

24 pages, 10 figures, conference paper