通过 LLMs 增强时变用户偏好的流式推荐中的 Bandit 算法
机器学习
2026-02-10 v1
摘要
在实际的流式推荐系统中,用户偏好随时间动态演化。现有的基于 bandit 的方法仅将时间视为时间戳,忽略了其与用户偏好之间的显式关系,导致性能 suboptimal。此外,线上学习方法在早期在线阶段常因探索-开发不够高效而受限。为解决此问题,我们提出了 HyperBandit+,一种新型情境 bandit 策略,集成了时序感知的 hypernetwork 以适应时变用户偏好,并采用大语言模型辅助的 warm-start 机制(LLM Start)以提升早期在线阶段的探索-开发效率。具体而言,HyperBandit+ 利用神经网络输入时序特征,生成用于估计时变奖励的参数,捕捉时间与用户偏好之间的相关性。此外,LLM Start 机制通过多步数据增强模拟真实的交互数据,以实现有效的离线学习,为 bandit 策略在早期在线阶段提供 warm-start 参数。为满足实时流式推荐的需求,我们采用低秩分解以降低 hypernetwork 的训练复杂度。理论上,我们严格建立了一个考虑 hypernetwork 与 LLM warm-start 机制的亚线性 regret 上界。大量实验表明,HyperBandit+ 在累积奖励方面 consistently 优于最先进的基线方法。
引用
@article{arxiv.2602.08067,
title = {Enhancing Bandit Algorithms with LLMs for Time-varying User Preferences in Streaming Recommendations},
author = {Chenglei Shen and Yi Zhan and Weijie Yu and Xiao Zhang and Jun Xu},
journal= {arXiv preprint arXiv:2602.08067},
year = {2026}
}