基于预训练神经网络的情境 bandit 优化
仪器与探测器
2025-06-24 v2 高能天体物理现象
高能物理 - 实验
摘要
bandit优化是一个困难的问题,尤其是当奖励模型是高维时。当奖励由神经网络建模时,只有在网络极宽的情况下才显示出亚线性 regret。在本论文中,我们研究了在更小模型的范畴内,预训练如何帮助我们。我们考虑一个随机情境bandit,其奖励由多层神经网络建模。最后一层是一个线性预测器,而其前的层是一个黑箱神经网络结构,我们将其称为表示网络。我们将预训练建模为提供给学习者的表示网络权重的初始猜测。为利用预训练权重,我们引入一种新算法,称为 Explore Twice then Commit(E2TC)。在其两个探索阶段,算法首先使用岭回归估计最后一层的权重,然后对所有权重进行随机梯度下降。对于局部凸损失函数,我们提供了预训练权重的条件,在这些条件下,算法可以高效学习。在这些条件下,我们证明了当最后一层的维度和动作数K相对于时域T较小时,E2TC具有亚线性 regret。对于弱训练体制,即仅学习最后一层的情况,问题可归约为一个未指定的线性bandit。我们引入一个度量ε₀用于该bandit,并据此提供界限O(ε₀√dKT+(KT)^{4/5})或 ã(O(ε₀√dKT+d^{1/3}(KT)^{2/3})),具体取决于正则化强度。前者界限具有与维度无关的亚线性项,这得益于情境的随机性。我们还进行了实验以评估E2TC的 regret以及其探索的样本复杂度。
引用
@article{arxiv.2501.06257,
title = {Resolution Limiting Factors in Low-Energy Cascade Zenith Angle Reconstruction with the IceCube Upgrade},
author = {Kaustav Dutta and Sebastian Böser and Jan Weldert and Martin Rongen},
journal= {arXiv preprint arXiv:2501.06257},
year = {2025}
}
备注
24 pages, 12 figures