中文

基于截断 ℓ2 范数的鲁棒上下文赌博机

机器学习 2017-08-21 v1 机器学习

摘要

本文考虑用于移动健康干预的 actor-critic 上下文赌博机。移动健康领域中最先进的决策方法通常假设动态系统中的噪声服从高斯分布。这些方法使用基于最小二乘的算法来估计期望奖励,这容易受到异常值的影响。为了处理异常值问题,我们为移动健康干预提出了一种新颖的鲁棒 actor-critic 上下文赌博机方法。在 critic 更新中,使用截断 ℓ2 范数来衡量近似误差,这可以防止异常值主导我们的目标。从 critic 更新中可以获得一组权重。考虑这些权重为 actor 更新提供了一个加权目标。这使得 critic 更新中噪声严重的样本在 actor 更新中获得零权重。因此,actor 和 critic 更新的鲁棒性都得到了增强。截断 ℓ2 范数中有一个关键参数。我们利用统计学中最基本的异常值定义之一,提供了一种可靠的方法来恰当地设置它。大量的实验结果表明,在没有异常值的数据集上,我们的方法可以获得与最先进方法几乎相同的结果,而在被异常值噪声污染的数据集上,其性能则显著优于它们。

关键词

引用

@article{arxiv.1708.05446,
  title  = {Robust Contextual Bandit via the Capped-$\ell_{2}$ norm},
  author = {Feiyun Zhu and Xinliang Zhu and Sheng Wang and Jiawen Yao and Junzhou Huang},
  journal= {arXiv preprint arXiv:1708.05446},
  year   = {2017}
}