带反馈的顺序选择Bandit算法用于个性化用户体验
机器学习
2021-01-06 v1 机器学习
多智能体系统
摘要
在本工作中,我们研究带反馈的顺序选择bandit问题。我们为个性化用户体验以最大化收益的平台提出bandit算法。对于指向给定用户的每个动作,若该动作低于用户阈值,平台会获得正收益,其为动作的非递减函数。用户配备耐心预算,高于阈值的动作会减少用户耐心。当耐心耗尽时,用户放弃平台。平台试图学习用户阈值以最大化其收益,基于描述平台在每次动作时可获信息模式的两种不同反馈模型。我们通过确定当平台知道用户阈值位于给定区间时应采取的最佳动作来定义后悔概念。然后我们针对两种反馈模型提出bandit算法,并证明后悔的上界和下界分别为 和 阶,其中 为用户总数。最后,我们证明任何用户在获得个性化体验前的等待时间关于 是一致有界的。
引用
@article{arxiv.2101.01572,
title = {Sequential Choice Bandits with Feedback for Personalizing users' experience},
author = {Anshuka Rangi and Massimo Franceschetti and Long Tran-Thanh},
journal= {arXiv preprint arXiv:2101.01572},
year = {2021}
}