面向重复新闻商问题的 Thompson 采样
人机交互
2025-02-17 v1
摘要
本文研究了 Thompson 采样(TS)在带有 censored 反馈的在线学习中的表现,主要聚焦于经典的重复新闻商模型——这是一个库存管理的基础框架,并展示了我们的技术如何可自然地扩展到更广泛的问题类别。我们首先使用 Weibull 分布建模需求,并使用 Gamma 先验初始化 TS 以动态调整订购数量。我们的分析在不施加限制性先验假设的前提下,为 TS 建立了最优(高达对数因子)的频率主义后悔值。更重要的是,它提供了关于 TS 如何解决重复新闻商情境下的 exploration-exploitation 折衷的新颖且高度可解释的见解。具体而言,我们的结果表明,当过去的订购数量足够大以克服 censored 现象时,TS 会准确估计未知需求参数,从而导致接近最优的订购决策。相反,当过去的订购量相对较小时,TS 会自动增加未来的订购量以收集更多需求信息。然后,我们将我们的分析扩展到更广泛的参数分布族,提供贝叶斯后悔的证明。大量数值仿真进一步表明,TS 在性能上优于更保守且广泛使用的方法,如在线凸优化、上置置信界和心理贝叶斯动态规划。
引用
@article{arxiv.2502.09899,
title = {Transtiff: A Stylus-shaped Interface for Rendering Perceived Stiffness of Virtual Objects via Stylus Stiffness Control},
author = {Ryoya Komatsu and Ayumu Ogura and Shigeo Yoshida and Kazutoshi Tanaka and Yuichi Itoh},
journal= {arXiv preprint arXiv:2502.09899},
year = {2025}
}
备注
11 pages, 16 figures