带有过参数化模型的离线上下文赌博机
机器学习
2021-06-17 v4 机器学习
摘要
监督学习近期的结果表明,虽然过参数化模型具有过拟合的能力,但实际上泛化得相当好。我们探究离线上下文赌博机中是否出现相同现象。我们的结果喜忧参半。基于价值的算法受益于与过参数化监督学习相同的泛化行为,但基于策略的算法则不然。我们表明这种差异源于其目标的动作稳定性(action-stability)。若一个目标存在某个预测(动作值向量或动作分布)无论观测到哪个动作都是最优的,则该目标是动作稳定的。基于价值的目标是动作稳定的,而基于策略的目标不稳定。我们形式化证明了过参数化基于价值学习的后悔(regret)上界以及基于策略算法的后悔下界。在使用大型神经网络的实验中,这种动作稳定的基于价值目标与不稳定的基于策略目标之间的差距导致了显著的性能差异。
引用
@article{arxiv.2006.15368,
title = {Offline Contextual Bandits with Overparameterized Models},
author = {David Brandfonbrener and William F. Whitney and Rajesh Ranganath and Joan Bruna},
journal= {arXiv preprint arXiv:2006.15368},
year = {2021}
}