未知公平性度量下的在线学习
机器学习
2018-09-19 v2
摘要
我们考虑线性上下文_bandit 设置下的在线学习问题,但其中还存在由未知相似性度量支配的强个体公平性约束。这些约束要求我们以近似相等的概率选择相似的动作或个体(arXiv:1104.3913),这可能与优化奖励相冲突,从而建模了利润与社会政策相张力之下的情形。我们假设仅从识别公平性违背的弱反馈中了解未知的 Mahalanobis 相似性度量,但该反馈不量化违背程度。这旨在表示一个监管者“见到不公即知其为不公”却仍无法阐明个体间定量公平性度量的干预。我们的主要结果是在对抗性上下文设置下给出一种算法,其公平性违背次数仅对数依赖于 ,同时对最优公平策略取得 的最优后悔界。
引用
@article{arxiv.1802.06936,
title = {Online Learning with an Unknown Fairness Metric},
author = {Stephen Gillen and Christopher Jung and Michael Kearns and Aaron Roth},
journal= {arXiv preprint arXiv:1802.06936},
year = {2018}
}