在线凸博弈中风险厌恶的无悔学习
机器学习
2022-06-17 v2 计算机科学与博弈论
最优化与控制
摘要
我们考虑一个具有风险厌恶智能体的在线随机博弈,其目标是学习最优决策以最小化承受显著高成本的风险。具体而言,我们使用条件风险价值(Conditional Value at Risk, CVaR)作为风险度量,智能体可利用仅由其所选动作的成本值形式的 bandit 反馈来估计该度量。由于成本函数的分布依赖于通常不可观测的所有智能体的动作,它们本身未知,因此成本的 CVaR 值难以计算。为应对这一挑战,我们提出一种新的在线风险厌恶学习算法,该算法依赖于对 CVaR 梯度的单点零阶估计,而该梯度通过使用适当采样成本函数所估计出的 CVaR 值计算。我们证明该算法以高概率实现次线性后悔。我们还提出该算法的两种变体以提升性能。第一种变体依赖于一种新的采样策略,利用前一次迭代的样本来提高 CVaR 值的估计精度。第二种变体采用残差反馈,利用前一次迭代的 CVaR 值来降低 CVaR 梯度估计的方差。我们从理论上分析了这些变体的收敛性质,并在一个建模为古诺博弈的在线市场问题上展示了其性能。
引用
@article{arxiv.2203.08957,
title = {Risk-Averse No-Regret Learning in Online Convex Games},
author = {Zifan Wang and Yi Shen and Michael M. Zavlanos},
journal= {arXiv preprint arXiv:2203.08957},
year = {2022}
}