一种用于消除反馈循环的贝叶斯选择模型
机器学习
2019-08-22 v2 机器学习
摘要
个性化系统中的自我强化反馈循环通常是由于用户从基于先前选择系统性呈现的有限备选集中进行挑选而引起的。我们提出了一种基于 Luce 公理构建的贝叶斯选择模型,该模型显式地考虑了用户对备选方案的有限暴露。我们的模型是公平的——它不对未呈现的备选方案施加负向偏差,并且是实用的——在观察到少量交互后便能准确推断偏好估计。它还允许高效采样,从而基于 Thompson sampling 产生一种直接的在线呈现机制。我们的方法在仅探索可能呈现中的一小部分时,便能在学习呈现中实现低后悔。所提出的结构可作为交互式系统(例如推荐系统)中的构建模块复用,且免于反馈循环。
引用
@article{arxiv.1908.05640,
title = {A Bayesian Choice Model for Eliminating Feedback Loops},
author = {Gökhan Çapan and Ilker Gündoğdu and Ali Caner Türkmen and Çağrı Sofuoğlu and Ali Taylan Cemgil},
journal= {arXiv preprint arXiv:1908.05640},
year = {2019}
}