中文

信息导向的离线到在线强化学习

机器学习 2026-05-29 v1

摘要

从离线数据进行决策通常通过固定的离线数据为策略或评分模型提供热身,然后通过有限的在线交互进行细化。离线数据减少了不确定性,但并不消除探索的需要;它改变了剩余需要探索的内容。我们通过学习目标 χ\chi 与在条件化离线数据集 DN\mathcal{D}_N 后的在线轨迹之间的条件互信息 I(χ;τ1:TDN)I(\chi;\tau_{1:T}\mid\mathcal{D}_N) 来 formalize 剩余不确定性。这种观点自然导致信息导向抽样(IDS),这是一族以 η0\eta\ge 0 为参数的 method,通过在即时 regret 与信息增益之间进行权衡来选择动作。我们通过比例证书证明了 IDS 对于 IDS 通过的任意信息比率界限所继承的通用离线到在线贝叶斯 regret 界限。在已知动力学的贝叶斯线性奖励模型中,条件互信息具有 log-determinant 形式,vanilla IDS(η=0\eta=0)满足 O~ ⁣(Hdmin{T,\TCβ,IDS0(N,T)/N})\widetilde O\!\left(Hd\min\left\{\sqrt T,\T\sqrt{C^\dagger_{\beta,\mathrm{IDS}_0}(N,T)/N}\right\}\right),其中覆盖系数与 vanilla IDS 自身引发的访问分布有关。我们还识别了一个在探针被支配但信息丰富的 warm-start regime 中,vanilla IDS 选择探针而 Thompson 抽样从不这样做,从而给出常数因子的贝叶斯 regret 分离。受控的 bandit 实验和 D4RL 离线到在线 RL 实验验证了这一机制:IDS 在离线数据信息丰富但留下偏置或低概率剩余不确定性的 regime 中最有益,这一 regime 也存在于离线 RL、离线黑盒优化和贝叶斯优化中。

关键词

引用

@article{arxiv.2605.29405,
  title  = {Information-Directed Offline-to-Online Reinforcement Learning},
  author = {Keru Chen},
  journal= {arXiv preprint arXiv:2605.29405},
  year   = {2026}
}