中文

用于数据驱动删失库存控制的上下文学习

机器学习 2026-05-15 v1 最优化与控制 机器学习

摘要

我们研究了具有决策依赖删失的库存控制,重点关注删失或重复报童(R-NV)问题,其中每次订货量决定了需求是被完全观测还是被销售删失。基于参数化 Thompson 采样(TS)的现有方法在先验失配下可能很脆弱,而离线插补方法未必能迁移到在线学习中。受决策的预测视角启发,我们通过在潜在需求的习得补全上采取神谕动作来结合这些思想。我们提出了上下文生成后验采样(ICGPS),它使用离线元训练且通过上下文自回归生成进行在线部署的现代生成模型。在理论上,我们证明了具有习得补全核的 ICGPS 的贝叶斯遗憾被具有理想补全核的 TS 基准的贝叶斯遗憾加上随 T\sqrt{T} 缩放的部署惩罚与补全失配平方根的乘积所界定。这为具有已知 TS 遗憾界限的运营问题提供了一个即插即用的模板。对于 R-NV,我们通过将删失反馈转化为带赌凸优化反馈来推导出次线性贝叶斯遗憾。我们还表明,在合理的覆盖率和稳定性假设下,在线补全失配由离线删失预测失配控制,因此离线预测质量可以迁移到在线性能。在实践中,我们用 ChronosFlow 实例化 ICGPS,它将冻结的时间序列 Transformer 主干与可训练的条件归一化流头相结合,以实现快速且与删失一致的采样。在基准实验中,ChronosFlow-ICGPS 与正确指定的 TS 相匹配,优于短视和 UCB 风格的基线,并且对先验失配和分布偏移具有鲁棒性。ChronosFlow-ICGPS 在真实世界的 SuperStore 数据集上也表现良好,尤其是在重度删失下。

关键词

引用

@article{arxiv.2605.14840,
  title  = {In-Context Learning for Data-Driven Censored Inventory Control},
  author = {Sohom Mukherjee and Anh-Duy Pham and Richard Pibernik and Yunbei Xu},
  journal= {arXiv preprint arXiv:2605.14840},
  year   = {2026}
}