基于深度强化学习的新闻vendor模型
机器学习
2021-12-28 v2
摘要
我提出了针对称为新闻vendor模型的数学问题的深度强化学习(RL)解法,该问题在给定概率需求分布下寻求利润优化。为反映更现实且复杂的情况,需求分布在一周的不同日子可能变化,从而改变最优行为。我使用了 Twin-Delayed Deep Deterministic Policy Gradient 智能体(以完全原创代码编写),具有 actor 与 critic 网络来解决此问题。该智能体能够学习与问题解析解一致的最优行为,并可识别一周中不同日子的独立概率分布并相应行动。
引用
@article{arxiv.2112.12544,
title = {Newsvendor Model with Deep Reinforcement Learning},
author = {Dylan K. Goetting},
journal= {arXiv preprint arXiv:2112.12544},
year = {2021}
}
备注
10 pages with 4 figures