中文

机制先验在序列决策中的价值

机器学习 2026-05-12 v1

摘要

混合机制模型——即物理先验与学习残差相结合的模型——有望减少做出良好决策所需的数据量,但目前缺乏可计算的准则来检验这一点。我们在渐近和预热两种情形下刻画了机制先验在序列决策中的价值。为了对此进行形式化,我们引入了模型的机制信息——即模型所推荐策略 π^\hat{\pi} 与真实最优策略 π\pi^* 之间的互信息——并通过占据度加权偏差 BμB_\mu 进行量化。在渐近情形下(大 NN),匹配的界表明贝叶斯遗憾随残差熵 HmechH_{\mathrm{mech}} 缩放,与无先验基线相比,带来了 H(μ)/HmechH(\mu)/H_{\mathrm{mech}} 的理论样本复杂度降低。此外,我们提供了一种模型证书来确定经验样本效率。作为补充,在具有临床相关性的预热情形下(小 NN),我们确立了对高置信度错误先验所导致惩罚的下界。我们在基于已发表 FOLFOX 药代动力学数据的 5-氟尿嘧啶 (5-FU) 给药模拟中验证了上述渐近和预热界,其中混合先验在预热情形下带来了巨大的样本效率提升。最后,我们将这些有物理依据的模型与 LLM 先验进行了对比,表明 LLM 可能会在机制信息上遭受严重损失,从而促使在安全关键型应用中专门使用基于物理的先验。

关键词

引用

@article{arxiv.2605.10018,
  title  = {The Value of Mechanistic Priors in Sequential Decision Making},
  author = {Itai Shufaro and Gal Benor and Shie Mannor},
  journal= {arXiv preprint arXiv:2605.10018},
  year   = {2026}
}