中文

失真风险度量优化的随机逼近方法

机器学习 2025-10-07 v1 最优化与控制

摘要

失真风险度量(Distortion Risk Measures, DRMs)捕捉决策中对风险偏好,作为管理不确定性的通用准则。本文提出基于两种对偶表示形式的梯度下降算法用于 DRM 优化:分别为失真度量(Distortion-Measure, DM)形式和分位数函数(Quantile-Function, QF)形式。DM 形式采用三时间尺度算法来跟踪分位数、计算其梯度并更新决策变量,运用广义似然比和核密度估计。QF 形式提供更简单的时间尺度方法,无需复杂的分位数梯度估计。混合形式整合了两种方法,针对失真函数突变处的鲁棒性能以及平滑区域的效率。本文提供所提算法的强收敛性及收敛率证明。特别地,DM 形式实现了最优收敛率 O(k4/7)O(k^{-4/7}),而 QF 形式达到更快的收敛率 O(k2/3)O(k^{-2/3})。数值实验确认其有效性,并在稳健组合投资任务中显著优于基线方法。该方法的可扩展性进一步通过集成到深度强化学习中得到展示。具体地,开发了基于 DRM 的近端策略优化(PPO)算法,用于多层级动态库存管理,展示了其实际应用价值。

关键词

引用

@article{arxiv.2510.04563,
  title  = {Stochastic Approximation Methods for Distortion Risk Measure Optimization},
  author = {Jinyang Jiang and Bernd Heidergott and Jiaqiao Hu and Yijie Peng},
  journal= {arXiv preprint arXiv:2510.04563},
  year   = {2025}
}