通过批量学习实现双峰环境中强化学习智能体的稳定训练
机器学习
2023-07-04 v1 人工智能
摘要
双峰随机环境对典型的强化学习问题提出了挑战。该问题在现实世界应用中出奇地常见,尤其适用于定价问题。本文提出了一种针对表格Q-learning算法的新型学习方法,通过使用批量更新来应对这些特定挑战。我们以定价问题的模拟作为测试平台,将典型更新的智能体与批量学习智能体进行比较。结果表明,批量学习智能体不仅比典型训练的智能体更有效,而且对大型随机环境中的波动更具韧性。这项工作在定价及其他场景中实现强化学习的实际工业部署具有显著潜力。
引用
@article{arxiv.2307.00923,
title = {Achieving Stable Training of Reinforcement Learning Agents in Bimodal Environments through Batch Learning},
author = {E. Hurwitz and N. Peace and G. Cevora},
journal= {arXiv preprint arXiv:2307.00923},
year = {2023}
}