中文

$\epsilon$-策略梯度用于在线定价

机器学习 2024-05-07 v1 最优化与控制 统计金融 机器学习

摘要

结合基于模型和无模型的强化学习方法,本文提出并分析了一种用于在线定价学习任务的ϵ\epsilon-策略梯度算法。该算法通过用梯度下降步骤替代贪婪利用来扩展ϵ\epsilon-贪婪算法,并通过模型推理促进学习。我们通过以探索概率ϵ\epsilon量化探索成本,以及以梯度下降优化和梯度估计误差量化利用成本,来优化所提算法的遗憾。该算法在TT次试验中实现了O(T)\mathcal{O}(\sqrt{T})阶(至多对数因子)的期望遗憾。

关键词

引用

@article{arxiv.2405.03624,
  title  = {$\epsilon$-Policy Gradient for Online Pricing},
  author = {Lukasz Szpruch and Tanut Treetanthiploet and Yufei Zhang},
  journal= {arXiv preprint arXiv:2405.03624},
  year   = {2024}
}