具有非平稳分布的风险规避学习
系统与控制
2024-04-05 v1 机器学习
系统与控制
摘要
在在线优化中考虑非平稳环境,使决策者能够有效地适应变化并随时间提升其性能。在这种情况下,采取最小化变化负面影响的策略以避免潜在的风险情况是有利的。在本文中,我们研究了随机成本分布随时间变化的风险规避在线优化问题。我们使用条件风险价值 (Conditional Value at Risk, CVaR) 作为风险度量来最小化风险规避目标函数。由于难以获得精确的 CVaR 梯度,我们采用零阶优化方法,在每次迭代中多次查询成本函数值,并利用采样值估计 CVaR 梯度。为了便于进行遗憾分析,我们使用基于 Wasserstein 距离的变差度量来刻画时变分布。假设分布变差关于总回合数是次线性的,我们证明对于凸函数和强凸函数,我们设计的学习算法均能以高概率实现次线性动态遗憾。此外,理论结果表明,增加样本数量可降低动态遗憾上界,直至采样数达到特定极限。最后,我们提供了停车场动态定价的数值实验,以说明所设计算法的有效性。
引用
@article{arxiv.2404.02988,
title = {Risk-averse Learning with Non-Stationary Distributions},
author = {Siyi Wang and Zifan Wang and Xinlei Yi and Michael M. Zavlanos and Karl H. Johansson and Sandra Hirche},
journal= {arXiv preprint arXiv:2404.02988},
year = {2024}
}