中文

基于 Lorenz 支配实现可扩展且具公平性保证的多目标强化学习

机器学习 2026-03-27 v2

摘要

多目标强化学习 (MORL) 旨在学习一组优化多个、常常是相互冲突目标之间的 trade-off 的策略。MORL 比单目标 RL 更具计算复杂度,尤其是当目标数量增加时。此外,当目标涉及代理人或群体的偏好时,纳入公平性在重要且具有社会意义。本文引入一种 principled 的算法,将公平性纳入 MORL,同时提高了针对多目标问题的可扩展性。我们提议使用 Lorenz 支配来识别具有公平奖励分布的策略,提出 lambda-Lorenz 支配以实现灵活的公平性偏好。我们发布了一个新的、大规模真实世界交通规划环境,展示了该方法鼓励发现公平策略,显示出在两个大城市 (西安和阿姆斯特丹) 中的改进可扩展性。我们的方法在高维目标空间中超越了常见的多目标方法。

关键词

引用

@article{arxiv.2411.18195,
  title  = {Scalable Multi-Objective Reinforcement Learning with Fairness Guarantees using Lorenz Dominance},
  author = {Dimitris Michailidis and Willem Röpke and Diederik M. Roijers and Sennay Ghebreab and Fernando P. Santos},
  journal= {arXiv preprint arXiv:2411.18195},
  year   = {2026}
}

备注

32 pages. Published in Journal of Artificial Intelligence Research, Vol. 85, Article 31