一种用于深度随机上下文老虎机的高效算法
机器学习
2021-04-23 v2 计算机科学与博弈论
摘要
在随机上下文老虎机(SCB)问题中,智能体基于特定观测上下文选择动作,以最大化迭代过程中的累积奖励。近来已有若干研究使用深度神经网络(DNN)预测某动作的预期奖励,并通过基于随机梯度的方法训练DNN。然而,这些方法的收敛性分析被极大忽视,未能考察其是否及在何处收敛。本工作中,我们将使用DNN奖励函数的SCB表述为非凸随机优化问题,并设计一种分阶段随机梯度下降算法来优化该问题并确定动作策略。我们证明,以高概率,该算法所选择的动作序列收敛于尊重局部最优奖励函数的贪婪动作策略。我们进行了大量实验,以在多个真实世界数据集上证明所提算法的有效性与高效性。
引用
@article{arxiv.2104.05613,
title = {An Efficient Algorithm for Deep Stochastic Contextual Bandits},
author = {Tan Zhu and Guannan Liang and Chunjiang Zhu and Haining Li and Jinbo Bi},
journal= {arXiv preprint arXiv:2104.05613},
year = {2021}
}
备注
Accepted by AAAI 2021 Appendix uploaded