中文

从探索性用户学习最优推荐

机器学习 2021-10-08 v1 信息检索

摘要

我们提出一种新的问题设定以研究推荐系统与学生用户之间的序贯交互。不同于经典做法假设用户全知、静态且显式,我们勾勒了一个更真实的用户行为模型,在该模型下用户:1)若推荐明显劣于其他则拒绝;2)基于其接受推荐所获奖励更新自身效用估计;3)向系统隐瞒已实现奖励。我们在 KK 臂 bandit 框架中形式化系统与此类探索性用户间的交互,并研究系统侧学习最优推荐的问题。我们表明高效系统学习仍可能但更困难。具体而言,系统可在 O(1/δ)O(1/\delta) 次交互内以至少 1δ1-\delta 概率识别最优臂,且我们证明此为紧界。我们的发现与固定置信度最优臂识别问题的结果形成对比,后者可在 O(log(1/δ))O(\log(1/\delta)) 次交互内以 1δ1-\delta 概率识别最优臂。该差距说明了当系统从探索性用户对其推荐的显现偏好而非从已实现奖励中学习时,不得不付出的不可避免代价。

关键词

引用

@article{arxiv.2110.03068,
  title  = {Learning the Optimal Recommendation from Explorative Users},
  author = {Fan Yao and Chuanhao Li and Denis Nekipelov and Hongning Wang and Haifeng Xu},
  journal= {arXiv preprint arXiv:2110.03068},
  year   = {2021}
}