一种用于风险厌恶在线凸博弈的零阶动量方法
机器学习
2022-09-08 v1 计算机科学与博弈论
机器学习
摘要
我们考虑重复未知博弈中的风险厌恶学习,其中智能体的目标是最小化其遭受显著高成本的风险。具体而言,智能体使用条件风险价值(CVaR)作为风险度量,并依赖每轮所选动作成本值的 bandit 反馈来估计其 CVaR 值并更新其动作。使用 bandit 反馈估计 CVaR 的一个主要挑战是智能体只能访问自身的成本值,然而该值依赖于所有智能体的动作。为应对此挑战,我们提出了一种利用成本值完整历史信息、带动量的新风隐厌学习算法。我们证明该算法实现了次线性后悔(sub-linear regret),并与文献中已知最优算法相匹配。我们给出了一个古诺博弈的数值实验,表明我们的方法优于现有方法。
引用
@article{arxiv.2209.02838,
title = {A Zeroth-Order Momentum Method for Risk-Averse Online Convex Games},
author = {Zifan Wang and Yi Shen and Zachary I. Bell and Scott Nivison and Michael M. Zavlanos and Karl H. Johansson},
journal= {arXiv preprint arXiv:2209.02838},
year = {2022}
}