用于多维在线决策的随机低秩张量_bandits
机器学习
2024-02-14 v3 机器学习
摘要
多维在线决策在许多实际应用(如在线推荐与数字营销)中起着关键作用。这类问题中,每次决策是来自不同类型实体的选择组合。为此,我们引入随机低秩张量_bandits,一类均值奖励可表示为低秩张量的_bandits。我们考虑两种设定:无上下文张量_bandits 与有上下文张量_bandits。在第一种设定中,平台旨在找到具有最高期望奖励的最优决策,即真实奖励张量的最大元素。在第二种设定中,张量的部分模为上下文、其余模为决策,目标是在给定上下文信息下找到最优决策。我们针对无上下文张量_bandits 提出两种学习算法——张量消除与张量 epoch-greedy,并导出其有限时间后悔界。与现有竞争方法相比,张量消除具有最佳的整体后悔界,而张量 epoch-greedy 对奖励张量维数的依赖更尖锐。此外,我们开发了名为张量集成采样、实际有效的贝叶斯算法用于有上下文张量_bandits。在线广告数据上的大量仿真与实证分析支持了我们的理论发现,并表明我们的算法优于各种忽略张量低秩结构的 SOTA 方法。
引用
@article{arxiv.2007.15788,
title = {Stochastic Low-rank Tensor Bandits for Multi-dimensional Online Decision Making},
author = {Jie Zhou and Botao Hao and Zheng Wen and Jingfei Zhang and Will Wei Sun},
journal= {arXiv preprint arXiv:2007.15788},
year = {2024}
}
备注
Accepted by Journal of the American Statistical Association