中文

面向具有自适应偏好智能体的多样化推荐

信息检索 2022-10-26 v2 计算机科学与博弈论 机器学习

摘要

当一个智能体(Agent)访问一个向其提供内容菜单以供选择的推荐平台时,其对条目的选择不仅取决于固定的偏好,还取决于其先前与平台的互动。推荐系统(Recommender)的主要目标通常是鼓励内容消费以优化某种奖励(如广告收入),但它们往往也旨在确保智能体随时间消费广泛多样的内容。我们将此问题形式化为一个对抗式赌博机(adversarial bandit)任务。在每一步,推荐系统向智能体呈现一个由 kk 个(共 nn 个)条目组成的菜单,智能体根据其未知的偏好模型从菜单中选择一个条目,该模型将其过往条目历史映射为相对选择概率。推荐系统随后观察智能体所选条目并获得该条目奖励的赌博机反馈。除优化所选条目的奖励外,推荐系统还必须确保所选条目的总体分布具有足够高的熵。我们定义了一类局部可学习的偏好模型,即仅通过观察一个小区域内的行为即可估计整个域上的行为;这包括可由有界次多项式以及具有稀疏傅里叶基的函数表示的模型。对于该类模型,我们给出了推荐系统的一个算法,该算法在所有满足两个条件的条目分布下获得 O~(T3/4)\tilde{O}(T^{3/4}) 后悔(regret):它们充分多样化,且在任意历史下可通过某个菜单分布瞬时实现。我们表明这些条件密切相关:所有足够高熵的分布均可在任意条目历史下瞬时实现。我们还给出了一组负面结果以证明我们的假设,形式包括非局部学习的运行时间下界以及针对替代基准的线性后悔下界。

关键词

引用

@article{arxiv.2210.07773,
  title  = {Diversified Recommendations for Agents with Adaptive Preferences},
  author = {Arpit Agarwal and William Brown},
  journal= {arXiv preprint arXiv:2210.07773},
  year   = {2022}
}

备注

34 pages, forthcoming in NeurIPS 2022