中文

ReLU 神经网络的随机 bandit 问题

机器学习 2024-05-14 v1 数据结构与算法 机器学习

摘要

我们研究了具有 ReLU 神经网络结构的随机 bandit 问题。我们表明,通过考虑单层 ReLU 神经网络的 bandit,可以实现 O~(T)\tilde{O}(\sqrt{T}) 的 regret 上界;据我们所知,这是首次实现此类上界。在此特定设置下,我们提出了 OFU-ReLU 算法,可实现此上界。算法首先随机探索,直至进入线性范数,然后实施基于 UCB 的线性 bandit 算法来平衡探索与开发。我们的关键洞察是,我们可以利用 ReLU 激活函数的分段线性结构,在学习到 ReLU 参数较为准确后,将问题转换为 transformed feature space 中的线性 bandit。为消除对模型参数的依赖,我们基于批处理策略设计了 OFU-ReLU+ 算法,可提供相同的理论保证。

关键词

引用

@article{arxiv.2405.07331,
  title  = {Stochastic Bandits with ReLU Neural Networks},
  author = {Kan Xu and Hamsa Bastani and Surbhi Goel and Osbert Bastani},
  journal= {arXiv preprint arXiv:2405.07331},
  year   = {2024}
}