中文

具有凸损失的风险感知线性_bandits

机器学习 2023-03-28 v2 机器学习

摘要

在多臂_bandit等决策问题中,智能体通过优化某种反馈进行序贯学习。虽然均值奖励准则已被广泛研究,但反映对不利结果厌恶的其他度量,如均值-方差或条件风险价值(CVaR),对关键应用(医疗、农业)可能具有重要意义。已有算法针对无上下文信息的_bandit反馈下的此类风险感知度量提出。本工作中,我们研究上下文_bandits,其中此类风险度量可通过凸损失的最小化作为上下文的线性函数被引出。符合该框架的一个典型例子是期望分位数度量,它由非对称最小二乘问题的解给出。利用超鞅的混合方法,我们推导出此类风险度量估计的置信序列。然后我们提出一种乐观 UCB 算法来学习最优风险感知动作,其遗憾保证类似于广义线性_bandits。该方法在算法每轮需要求解一个凸问题,我们可以通过仅允许在线梯度下降获得的近似解来放宽,代价是略高的遗憾。最后我们通过数值实验评估所得算法。

关键词

引用

@article{arxiv.2209.07154,
  title  = {Risk-aware linear bandits with convex loss},
  author = {Patrick Saux and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:2209.07154},
  year   = {2023}
}