组合神经 Bandit
机器学习
2023-06-02 v1 机器学习
摘要
我们考虑一个上下文组合 bandit 问题,其中每轮学习智能体选择一组臂,并根据所选臂的得分接收关于这些臂的反馈。臂的得分是该臂特征的未知函数。用深度神经网络逼近该未知得分函数,我们提出算法:组合神经 UCB()与组合神经 Thompson 采样()。我们证明 达到 或 后悔界,其中 为神经正切核矩阵的有效维度, 为臂子集的大小, 为时间范围。对于 ,我们采用乐观采样技术以确保所采样组合动作的乐观性,达到 的最坏情况(频率派)后悔界。据我们所知,这些是首批具有后悔性能保证的组合神经 bandit 算法。特别地, 是首个针对一般上下文组合 bandit 问题具有最坏情况后悔保证的 Thompson 采样算法。数值实验证明了我们所提算法的优越性能。
引用
@article{arxiv.2306.00242,
title = {Combinatorial Neural Bandits},
author = {Taehyun Hwang and Kyuwook Chai and Min-hwan Oh},
journal= {arXiv preprint arXiv:2306.00242},
year = {2023}
}
备注
Accepted in ICML 2023