基于矩阵完成的在线策略学习与推断
机器学习
2024-12-20 v2 机器学习
摘要
当个性化协变量不可得时,如何进行在线决策?我们采用协同过滤方法,基于集体偏好进行决策。通过假设低维潜在特征,我们将无协变量决策问题形式化为矩阵完成bandit问题。我们提出一种策略学习程序,将用于决策的ε-greedy策略与用于bandit参数估计的在线梯度下降算法相结合。我们新近设计的两阶段方法在策略学习精度和regret性能之间取得平衡。对于策略推断,我们发展了一种基于逆倾向加权的在线去偏方法,并建立了其渐近正态性。我们的方法应用于旧金山停车定价项目的数据,揭示了有趣的发现并超越了基准策略。
引用
@article{arxiv.2404.17398,
title = {Online Policy Learning and Inference by Matrix Completion},
author = {Congyuan Duan and Jingyang Li and Dong Xia},
journal= {arXiv preprint arXiv:2404.17398},
year = {2024}
}