中文

基于深度强化学习的新闻vendor模型

机器学习 2021-12-28 v2

摘要

我提出了针对称为新闻vendor模型的数学问题的深度强化学习(RL)解法,该问题在给定概率需求分布下寻求利润优化。为反映更现实且复杂的情况,需求分布在一周的不同日子可能变化,从而改变最优行为。我使用了 Twin-Delayed Deep Deterministic Policy Gradient 智能体(以完全原创代码编写),具有 actor 与 critic 网络来解决此问题。该智能体能够学习与问题解析解一致的最优行为,并可识别一周中不同日子的独立概率分布并相应行动。

关键词

引用

@article{arxiv.2112.12544,
  title  = {Newsvendor Model with Deep Reinforcement Learning},
  author = {Dylan K. Goetting},
  journal= {arXiv preprint arXiv:2112.12544},
  year   = {2021}
}

备注

10 pages with 4 figures