基于 Lorenz 支配实现可扩展且具公平性保证的多目标强化学习
机器学习
2026-03-27 v2
摘要
多目标强化学习 (MORL) 旨在学习一组优化多个、常常是相互冲突目标之间的 trade-off 的策略。MORL 比单目标 RL 更具计算复杂度,尤其是当目标数量增加时。此外,当目标涉及代理人或群体的偏好时,纳入公平性在重要且具有社会意义。本文引入一种 principled 的算法,将公平性纳入 MORL,同时提高了针对多目标问题的可扩展性。我们提议使用 Lorenz 支配来识别具有公平奖励分布的策略,提出 lambda-Lorenz 支配以实现灵活的公平性偏好。我们发布了一个新的、大规模真实世界交通规划环境,展示了该方法鼓励发现公平策略,显示出在两个大城市 (西安和阿姆斯特丹) 中的改进可扩展性。我们的方法在高维目标空间中超越了常见的多目标方法。
引用
@article{arxiv.2411.18195,
title = {Scalable Multi-Objective Reinforcement Learning with Fairness Guarantees using Lorenz Dominance},
author = {Dimitris Michailidis and Willem Röpke and Diederik M. Roijers and Sennay Ghebreab and Fernando P. Santos},
journal= {arXiv preprint arXiv:2411.18195},
year = {2026}
}
备注
32 pages. Published in Journal of Artificial Intelligence Research, Vol. 85, Article 31