中文

通过公理性议价的公平探索

机器学习 2022-07-11 v2 机器学习

摘要

探索在在线学习中常为最大化长期奖励所必需,但其代价是短期的“后悔”。我们研究这一探索代价如何在多个群体间分摊。例如,在临床试验场景中,被分配到次优治疗的患者实际上承受了探索代价。当患者依据种族或年龄等自然群体归属时,很自然地会问:任一单一群体所承受的探索代价是否“公平”。受此驱动,我们引入“分组”赌博机模型。我们利用公理性议价理论,特别是纳什议价解,来形式化跨群体探索代价的公平划分可能由什么构成。一方面,我们表明任何后悔最优策略都会惊人地导致最不公平的结果:此类策略会在可能时反常地利用最“弱势”的群体。更具建设性的是,我们推导出最优公平且同时享有较小“公平代价”的策略。我们通过对华法林给药的上下文赌博机案例研究来说明我们算法框架的相对优势,其中我们关注跨多个种族与年龄组的探索代价。

关键词

引用

@article{arxiv.2106.02553,
  title  = {Fair Exploration via Axiomatic Bargaining},
  author = {Jackie Baek and Vivek F. Farias},
  journal= {arXiv preprint arXiv:2106.02553},
  year   = {2022}
}