中文

期望累积代价的最优无偏估计

数值分析 2020-05-26 v2 数值分析 最优化与控制 概率论

摘要

我们考虑通过蒙特卡洛模拟估计依赖于底层随机过程的期望无限 horizon 累积折扣代价/奖励。提出了一种基于在随机 horizon 处截断累积代价的无偏估计量。给出了随机 horizon 最优分布的显式形式,并获得了最优随机截断水平的显式表达式,从而在对这一类新的随机化估计量与传统的固定截断估计量进行比较时,对偏差-方差权衡进行了完整分析。此外,我们通过考虑偏差与方差之间的权衡,刻画了何时最优随机化估计量优于固定截断估计量。该比较为实践中何时选择随机化估计量而非固定截断估计量提供了指导。数值实验证实了理论结果。

关键词

引用

@article{arxiv.1804.04215,
  title  = {Optimal Unbiased Estimation for Expected Cumulative Cost},
  author = {Zhenyu Cui and Michael C. Fu and Yijie Peng and Lingjiong Zhu},
  journal= {arXiv preprint arXiv:1804.04215},
  year   = {2020}
}

备注

35 pages, 5 figures