中文

基于预训练神经网络的情境型臂bandit优化

机器学习 2025-01-14 v1

摘要

情境型臂bandit优化是一个非常困难的问题,尤其是当奖励模型是高维时。当奖励由神经网络建模时,仅在网络极宽的情况下才已证明具有亚线性 regret。本论文我们探讨了预训练如何帮助我们在较小模型的范畴内解决这一问题。我们考虑的是以多层神经网络建模的随机情境bandit问题。最后一层是线性预测器,其前面的层是一个黑箱神经网络结构,我们称其为表示网络。我们将预训练建模为对表示网络权重的初始猜测。为了利用预训练权重,我们引入一种新算法,称为Explore Twice then Commit (E2TC)。在其两个探索阶段,算法首先使用岭回归估计最后一层的权重,然后在所有权重上联合运行随机梯度下降。对于局部凸损失函数,我们提供了关于预训练权重的条件,以确保算法能够有效学习。在这些条件下,我们证明了当最后一层的维数和动作数量 KK 远小于时间段 TT 时,E2TC具有亚线性 regret。在弱训练 regime 中,仅学习最后一层,问题简化为一个未指定的线性bandit问题。我们为该bandit引入一种误指定度量 ϵ0\epsilon_0,并据此提供 regret 的上界为 O(ϵ0dKT+(KT)4/5)O(\epsilon_0\sqrt{d}KT+(KT)^{4 /5})O~(ϵ0dKT+d1/3(KT)2/3)\tilde{O}(\epsilon_0\sqrt{d}KT+d^{1 /3}(KT)^{2 /3}),具体取决于正则化强度。前者上界包含一个与维度无关的亚线性项,这是由情境的随机性所致。我们还进行了实验来评估E2TC的regret以及其探索的样本复杂度。

关键词

引用

@article{arxiv.2501.06258,
  title  = {Contextual Bandit Optimization with Pre-Trained Neural Networks},
  author = {Mikhail Terekhov},
  journal= {arXiv preprint arXiv:2501.06258},
  year   = {2025}
}

备注

Master's thesis