用于信息选择系统的 Top-K 排序深度上下文 Bandit
机器学习
2022-02-01 v1 信息检索
摘要
在当今的技术环境中,信息具有丰富、动态和异构的特点。信息的自动过滤与优先级排序,是基于信息是否对实现个人目标具有实质性价值来区分的。上下文多臂赌博机已广泛用于学习过滤内容并根据用户兴趣或相关性进行优先级排序。排序学习技术优化了项目的相关性排序,从而允许据此选择内容。我们提出了一种在上下文多臂赌博机框架下进行 Top-K 排序的新方法。我们使用神经网络对随机奖励函数进行建模,以允许非线性逼近来学习奖励与上下文之间的关系。我们展示了该方法,并使用真实世界数据集在模拟场景中评估了学习性能。实证结果表明,该方法在复杂的奖励结构和高维上下文特征下表现良好。
引用
@article{arxiv.2201.13287,
title = {Top-K Ranking Deep Contextual Bandits for Information Selection Systems},
author = {Jade Freeman and Michael Rawson},
journal= {arXiv preprint arXiv:2201.13287},
year = {2022}
}