中文

关于 Bandits 问题中 Soft-max 与策略梯度的短注

机器学习 2020-07-21 v1 机器学习

摘要

这是一篇关于 bandit 问题中 softmax 的 Lyapunov 函数论证的简短通讯。已有若干出色论文利用微分方程研究强化学习中的策略梯度算法 \cite{agarwal2019optimality,bhandari2019global,mei2020global}。我们给出一个简短论证,给出 bandit 问题中 soft-max 常微分方程的遗憾界。我们针对另一种不同的策略梯度算法推导了类似结果,同样针对 bandit 问题。对这第二种算法,可以在随机情形下证明遗憾界 \cite{DW20}。最后,我们总结了关于推导策略梯度随机遗憾界的一些想法与问题。

关键词

引用

@article{arxiv.2007.10297,
  title  = {A Short Note on Soft-max and Policy Gradients in Bandits Problems},
  author = {Neil Walton},
  journal= {arXiv preprint arXiv:2007.10297},
  year   = {2020}
}