中文

Nah Bandit:推荐系统中用户不遵从行为的建模

机器学习 2025-09-04 v2 信息检索 多智能体系统 系统与控制 系统与控制

摘要

推荐系统如今已渗透到数字世界,涵盖广告到娱乐等领域。然而,在物理世界(如出行或健康领域)中实施有效的推荐系统仍然具有挑战性。本工作聚焦于一个关键挑战:在物理世界中,用户如果不喜欢推荐内容,往往很容易选择不采纳任何推荐并回归其基线行为。因此,在网络物理推荐系统中,必须采用能够感知此类用户行为的交互模型,否则用户将完全放弃推荐。本论文因此提出了Nah Bandit(一个戏谑的称呼),用于描述用户可以对推荐说"不"并选择其偏好选项的Bandit问题。因此,该问题介于典型的Bandit设置与监督学习之间。我们通过参数化推荐对用户的锚定效应来建模用户的不遵从行为。随后,我们提出了Expert with Clustering (EWC)算法,一种分层方法,整合来自推荐选项和非推荐选项的反馈以加速用户偏好学习。在具有NN个用户、每个用户TT轮、KK个聚类的推荐场景中,EWC实现了O(NTlogK+NT)O(N\sqrt{T\log K} + NT)的遗憾界,在短期内相比LinUCB算法取得了优越的理论性能。实验结果也凸显EWC优于监督学习和传统上下文Bandit方法。这一进展揭示了有效利用不遵从反馈可以加速偏好学习并提高推荐准确性。本工作为Nah Bandit的未来研究奠定了基础,为更有效的推荐系统提供了稳健的框架。

关键词

引用

@article{arxiv.2408.07897,
  title  = {The Nah Bandit: Modeling User Non-compliance in Recommendation Systems},
  author = {Tianyue Zhou and Jung-Hoon Cho and Cathy Wu},
  journal= {arXiv preprint arXiv:2408.07897},
  year   = {2025}
}

备注

12 pages, 8 figures, accepted by IEEE Transactions on Control of Network Systems