探索的外部性以及数据多样性如何助力利用
机器学习
2018-07-04 v2 计算机与社会
机器学习
摘要
在线学习算法被广泛用于驱动网络上的搜索与内容优化,必须在探索与利用之间取得平衡,可能以牺牲当前用户的体验为代价来获取能在未来带来更优决策的信息。近来,人们担忧探索过程是否可被视作不公平,即对某些个体或群体施加了过多负担。受这些担忧驱动,我们在线性的上下文赌博机模型下,开启了对探索外部性——即一方存在可能对另一方施加的不良副作用——的研究。我们引入群体外部性的概念,衡量某一用户群体的存在影响另一群体奖励的程度。我们表明这种影响在某些情况下可为负,并且在某种意义下任何算法都无法避免它。随后我们在个体层面研究外部性,将探索行为解释为未来用户对系统当前用户施加的外部性。这促使我们追问:在何种条件下,数据固有的多样性使得显式探索不再必要。我们基于近期关于贪心算法平滑分析的工作展开,该贪心算法总是选择当前看似最优的动作,改进了先前结果,表明只要多样性条件成立,贪心方法几乎匹配同一问题实例上任何其他算法的最佳可能贝叶斯遗憾率,且该遗憾至多为 。回到群体层面效应,我们表明在相同条件下,负群体外部性在贪心算法下基本消失。综上,我们的结果揭示了最坏情况下存在的高外部性,与若数据足够多样则可消除所有外部性之间的鲜明对比。
引用
@article{arxiv.1806.00543,
title = {The Externalities of Exploration and How Data Diversity Helps Exploitation},
author = {Manish Raghavan and Aleksandrs Slivkins and Jennifer Wortman Vaughan and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:1806.00543},
year = {2018}
}