高维数据下广义线性模型的在线学习与决策
机器学习
2018-12-10 v1 机器学习
摘要
我们提出了一种在广义线性模型下的极小极大凹惩罚多臂_bandit 算法(G-MCP-Bandit),用于在线学习与决策过程中面对高维数据的决策者。我们证明了 G-MCP-Bandit 算法在样本量维度 T 上渐近达到最优累积后悔 O(log T),并进一步在协变量维度 d 上获得紧界 O(log d)。此外,我们开发了线性近似方法——两步加权 Lasso 过程,以在非独立同分布样本下为 G-MCP-Bandit 算法识别 MCP 估计量。在该过程下,MCP 估计量以高概率匹配 oracle 估计量,并以最优收敛速率收敛到真实参数。最后,通过基于合成数据和两个真实数据集(华法林 dosing 数据集和腾讯搜索广告数据集)的实验,我们表明 G-MCP-Bandit 算法优于其他基准算法,尤其在数据高度稀疏或决策集较大时。
引用
@article{arxiv.1812.02962,
title = {Online Learning and Decision-Making under Generalized Linear Model with High-Dimensional Data},
author = {Xue Wang and Mike Mingcheng Wei and Tao Yao},
journal= {arXiv preprint arXiv:1812.02962},
year = {2018}
}