中文

基于矩阵完成的在线策略学习与推断

机器学习 2024-12-20 v2 机器学习

摘要

当个性化协变量不可得时,如何进行在线决策?我们采用协同过滤方法,基于集体偏好进行决策。通过假设低维潜在特征,我们将无协变量决策问题形式化为矩阵完成bandit问题。我们提出一种策略学习程序,将用于决策的ε-greedy策略与用于bandit参数估计的在线梯度下降算法相结合。我们新近设计的两阶段方法在策略学习精度和regret性能之间取得平衡。对于策略推断,我们发展了一种基于逆倾向加权的在线去偏方法,并建立了其渐近正态性。我们的方法应用于旧金山停车定价项目的数据,揭示了有趣的发现并超越了基准策略。

关键词

引用

@article{arxiv.2404.17398,
  title  = {Online Policy Learning and Inference by Matrix Completion},
  author = {Congyuan Duan and Jingyang Li and Dong Xia},
  journal= {arXiv preprint arXiv:2404.17398},
  year   = {2024}
}