中文

联合神经上下文赌博机的不确定性

机器学习 2024-06-05 v1

摘要

上下文赌博机学习在现代大规模推荐系统中越来越受欢迎。为了更好地利用上下文信息和可用的用户或物品特征,引入了神经网络的集成以增强上下文赌博机学习,并引起了学术界和工业界的极大兴趣。然而,在大规模推荐系统中实现分离的神经上下文赌博机解决方案时出现了一个主要挑战,其中每个物品或用户可能对应一个独立的赌博机臂。需要推荐的大量物品对实际生产部署构成了重大障碍。本文专注于联合神经上下文赌博机解决方案,该方案在一个单一模型中服务于所有推荐物品。输出包括预测奖励μ\mu、不确定性σ\sigma和平衡探索与利用的超参数α\alpha,例如μ+ασ\mu + \alpha \sigma。参数α\alpha的调整在实践中通常是启发式的且复杂的,因为其随机性质。为了解决这一挑战,我们提供了关于联合神经上下文赌博机模型不确定性σ\sigma的理论分析和实验结果。我们的分析揭示,α\alpha与最后一个隐藏层的大小FF呈近似平方根关系,与训练数据量NN呈近似反平方根关系,即σFN\sigma \propto \sqrt{\frac{F}{N}}。使用真实工业数据进行的实验与理论分析一致,有助于理解模型行为,并辅助离线训练和在线部署期间的超参数调整。

关键词

引用

@article{arxiv.2406.02515,
  title  = {Uncertainty of Joint Neural Contextual Bandit},
  author = {Hongbo Guo and Zheqing Zhu},
  journal= {arXiv preprint arXiv:2406.02515},
  year   = {2024}
}