基于偏好的强化学习中的公平性
机器学习
2023-09-04 v2 人工智能
计算机与社会
系统与控制
系统与控制
摘要
在本文中,我们解决了在多目标情形下基于偏好的强化学习(PbRL)中的公平性问题。主要目标是设计能够优化多个目标同时公平对待每个目标的控制策略。为实现该目标,我们设计了一种新的公平性诱导的基于偏好的强化学习,即 FPbRL。FPbRL 的主要思想是通过基于福利的新的偏好而非 PbRL 中基于奖励的偏好来学习对应于多个目标的向量奖励函数,并结合通过最大化广义基尼福利函数进行的策略学习。最后,我们在三种不同环境下提供实验研究,表明所提出的 FPbRL 方法能够在学习有效且公平的策略时同时实现效率与公平。
引用
@article{arxiv.2306.09995,
title = {Fairness in Preference-based Reinforcement Learning},
author = {Umer Siddique and Abhinav Sinha and Yongcan Cao},
journal= {arXiv preprint arXiv:2306.09995},
year = {2023}
}
备注
Accepted to The Many Facets of Preference Learning Workshop at the International Conference on Machine Learning (ICML)