中文

后验无偏前沿提取:用于连续控制的 Pareto 前沿

机器学习 2026-03-04 v1

摘要

在实际世界中,智能体常常必须在连续控制中平衡多个目标,如速度、稳定性和能源效率。为了应对不断变化的条件和偏好,智能体理想情况下应学习一组代表多个最优权衡的 Pareto 前沿策略。最近的多策略多目标强化学习(MORL)技术使直接学习 Pareto 前沿成为可能,但要求从训练初期就完全考虑多目标。在实践中,多目标偏好常常在针对特定单一目标训练了策略后才出现。现有的 MORL 方法无法利用这些已训练的“专家”策略来学习 Pareto 前沿,也无法避免重新训练的样本成本。我们引入混合优势 Pareto 提取(MAPEX),这是一种离线 MORL 方法,通过重用预训练的专家策略、评论家和回放缓冲区来构建策略前沿。MAPEX 将专家评论家的评估组合成混合优势信号,并对行为克隆损失进行加权,以训练能够平衡多个目标的新策略。MAPEX 的后验 Pareto 前沿提取保留了单目标离线强化学习的简单性,避免了将这些算法改造成复杂 MORL 框架的需求。在五个多目标 MuJoCo 环境上对 MAPEX 进行了形式化描述和评估。给定相同的起始策略时,MAPEX 在样本成本上仅为既定基线的 0.001%,即便如此也能产生可比的结果。

关键词

引用

@article{arxiv.2603.02628,
  title  = {Post Hoc Extraction of Pareto Fronts for Continuous Control},
  author = {Raghav Thakar and Gaurav Dixit and Kagan Tumer},
  journal= {arXiv preprint arXiv:2603.02628},
  year   = {2026}
}

备注

10 pages, 4 figures. Submitted to IJCAI 2026