因果_bandit 的反事实公平性实现
机器学习
2021-09-23 v1 人工智能
计算机与社会
摘要
在在线推荐中,顾客以顺序且随机的方式从潜在分布中到达,在线决策模型基于某种策略为每个到达的个体推荐选定物品。我们研究如何在每一步推荐物品以最大化期望奖励,同时实现用户侧公平性,即拥有相似画像的顾客无论其敏感属性与所推荐物品如何,都将获得相似奖励。通过将因果推断引入 bandit 并采用软干预建模臂选择策略,我们首先提出基于 d-分离的上置信界算法(D-UCB),以探索 d-分离集在减少实现低累积遗憾所需探索量方面的利用。在此基础上,我们进一步提出公平因果 bandit(F-UCB)以实现反事实个体公平性。理论分析与经验评估均证明了我们算法的有效性。
引用
@article{arxiv.2109.10458,
title = {Achieving Counterfactual Fairness for Causal Bandit},
author = {Wen Huang and Lu Zhang and Xintao Wu},
journal= {arXiv preprint arXiv:2109.10458},
year = {2021}
}