中文

通过策略后悔度解决机器学习决策的长期影响

机器学习 2021-06-03 v1 人工智能 计算机与社会 机器学习

摘要

机器学习(ML)日益在借贷、教育、就业等领域中指导对个体与社区的机会分配。此类决策往往以其事先未知的方式影响受体的未来特征与能力。因此,决策者在面对类似多臂老虎机中的探索-利用困境。遵循已有工作,我们将社区建模为臂。为刻画基于 ML 的分配决策的长期效应,我们研究这样一种设定:每次决策者拉动某臂时,该臂的奖励随之演化。我们关注初始随拉动次数递增、但在某点之后可能转为(并维持)递减的奖励函数。我们认为,可接受的机会顺序分配必须将臂的增长潜力纳入考量。我们通过策略后悔度(policy regret)这一概念来捕捉这些考量,它远强于常被研究的外部后悔度(external regret),并给出一种在足够长时间视野下具有可证明次线性策略后悔度的算法。我们通过实验将该算法与若干基线比较,发现其在长视野下尤其持续优于它们。

关键词

引用

@article{arxiv.2106.01325,
  title  = {Addressing the Long-term Impact of ML Decisions via Policy Regret},
  author = {David Lindner and Hoda Heidari and Andreas Krause},
  journal= {arXiv preprint arXiv:2106.01325},
  year   = {2021}
}

备注

Accepted to IJCAI 2021