中文

组合神经 Bandit

机器学习 2023-06-02 v1 机器学习

摘要

我们考虑一个上下文组合 bandit 问题,其中每轮学习智能体选择一组臂,并根据所选臂的得分接收关于这些臂的反馈。臂的得分是该臂特征的未知函数。用深度神经网络逼近该未知得分函数,我们提出算法:组合神经 UCB(CN-UCB\texttt{CN-UCB})与组合神经 Thompson 采样(CN-TS\texttt{CN-TS})。我们证明 CN-UCB\texttt{CN-UCB} 达到 O~(d~T)\tilde{\mathcal{O}}(\tilde{d} \sqrt{T})O~(d~TK)\tilde{\mathcal{O}}(\sqrt{\tilde{d} T K}) 后悔界,其中 d~\tilde{d} 为神经正切核矩阵的有效维度,KK 为臂子集的大小,TT 为时间范围。对于 CN-TS\texttt{CN-TS},我们采用乐观采样技术以确保所采样组合动作的乐观性,达到 O~(d~TK)\tilde{\mathcal{O}}(\tilde{d} \sqrt{TK}) 的最坏情况(频率派)后悔界。据我们所知,这些是首批具有后悔性能保证的组合神经 bandit 算法。特别地,CN-TS\texttt{CN-TS} 是首个针对一般上下文组合 bandit 问题具有最坏情况后悔保证的 Thompson 采样算法。数值实验证明了我们所提算法的优越性能。

关键词

引用

@article{arxiv.2306.00242,
  title  = {Combinatorial Neural Bandits},
  author = {Taehyun Hwang and Kyuwook Chai and Min-hwan Oh},
  journal= {arXiv preprint arXiv:2306.00242},
  year   = {2023}
}

备注

Accepted in ICML 2023