$\epsilon$-策略梯度用于在线定价
机器学习
2024-05-07 v1 最优化与控制
统计金融
机器学习
摘要
结合基于模型和无模型的强化学习方法,本文提出并分析了一种用于在线定价学习任务的-策略梯度算法。该算法通过用梯度下降步骤替代贪婪利用来扩展-贪婪算法,并通过模型推理促进学习。我们通过以探索概率量化探索成本,以及以梯度下降优化和梯度估计误差量化利用成本,来优化所提算法的遗憾。该算法在次试验中实现了阶(至多对数因子)的期望遗憾。
引用
@article{arxiv.2405.03624,
title = {$\epsilon$-Policy Gradient for Online Pricing},
author = {Lukasz Szpruch and Tanut Treetanthiploet and Yufei Zhang},
journal= {arXiv preprint arXiv:2405.03624},
year = {2024}
}