安全在线重排序中对未排序项的探索
信息检索
2023-05-03 v1 机器学习
摘要
用于在线学习重排序(OLTR)问题的_bandit_算法常旨在利用用户反馈最大化长期收益。然而从实际角度看,此类算法因激进探索而有较高损害用户体验的风险,因此近年来对安全探索的需求上升。安全探索的一种思路是逐步提升已保证可接受质量的原始排序的质量。本文提出一种安全 OLTR 算法,通过将当前排序中某一项与排序外一项(即未排序项)高效交换来进行探索。我们基于 Kullback-Leibler 上置信界(KL-UCB)乐观地选择未排序项进行探索,并对含所选项的物品进行安全重排序。实验表明,所提算法在无任何安全违规下较基线改善了长期后悔值。
引用
@article{arxiv.2305.01202,
title = {Exploration of Unranked Items in Safe Online Learning to Re-Rank},
author = {Hiroaki Shiino and Kaito Ariu and Kenshi Abe and Togashi Riku},
journal= {arXiv preprint arXiv:2305.01202},
year = {2023}
}