线性上下文_bandits中的群体精英公平
机器学习
2022-12-21 v3 机器学习
摘要
我们研究线性上下文_bandit问题,其中智能体必须从候选池中选择一名候选者,且每名候选者属于一个敏感群体。在此设定下,候选者的奖励在群体之间可能不直接可比,例如当智能体是雇佣来自不同族群候选者的雇主,且某些群体因歧视性偏见和/或社会不公而具有较低奖励时。我们提出一种公平概念,即智能体的策略在选择具有最高相对排名的候选者时是公平的,相对排名衡量的是与同群体候选者相比奖励的好坏程度。这是一个非常强的公平性概念,因为相对排名并非由智能体直接观测,且依赖于底层奖励模型和奖励分布。因此我们研究在学习一种近似公平策略的问题,条件是群体间上下文独立且各群体奖励分布绝对连续。特别地,我们设计了一种贪心策略,其在每轮从观测到的上下文-奖励对构建岭回归估计,然后使用经验累积分布函数计算每名候选者的相对排名估计。我们证明,尽管该贪心策略简单且缺乏初始探索阶段,但其以高概率在 T 轮后达到阶数为 的公平伪遗憾(忽略对数因子),其中 d 为上下文向量的维度。该策略在每轮当对选择前所有可用信息进行平均时也满足人口均等的。最后,我们使用模拟设定和 US 人口普查数据的实验表明,我们的策略在实践中也实现了次线性公平伪遗憾。
引用
@article{arxiv.2206.03150,
title = {Group Meritocratic Fairness in Linear Contextual Bandits},
author = {Riccardo Grazzi and Arya Akhavan and John Isak Texas Falk and Leonardo Cella and Massimiliano Pontil},
journal= {arXiv preprint arXiv:2206.03150},
year = {2022}
}
备注
NeurIPS 2022. Code for the experiments at https://github.com/CSML-IIT-UCL/GMFbandits