中文

连续动作情境_bandit:平滑、缩放与自适应

机器学习 2020-06-23 v4 机器学习

摘要

我们研究具有抽象策略类与连续动作空间的情境_bandit 学习。我们得到两类性质不同的悔界:其一在无非连续性假设下与策略类的平滑版本竞争,另一类则需要标准的 Lipschitz 假设。两类界均展现出数据依赖的“缩放”行为,且在无需调参的情况下为良性问题提供了改进的保证。我们还研究了对未知平滑参数的自适应,确立了自适应性代价并推导了无需额外信息的最优自适应算法。

关键词

引用

@article{arxiv.1902.01520,
  title  = {Contextual Bandits with Continuous Actions: Smoothing, Zooming, and Adapting},
  author = {Akshay Krishnamurthy and John Langford and Aleksandrs Slivkins and Chicheng Zhang},
  journal= {arXiv preprint arXiv:1902.01520},
  year   = {2020}
}

备注

41 pages, 1 figure, preliminary version in COLT 2019