中文

SNAPO:基于可微仿真的最优控制平滑神经伴随策略优化

机器学习 2026-05-08 v1 最优化与控制 计算金融 数理金融 风险管理

摘要

许多现实世界的问题需要在不确定性下做出序贯决策:何时向储气库注入或抽取气体,每月如何重新平衡养老金投资组合,在制药反应器链中运行何种温度曲线。动态规划能精确求解小规模实例,但在状态维度上呈指数级扩展。黑盒强化学习能处理高维状态,但训练缓慢且不产生敏感度。我们引入了 SNAPO(Smooth Neural Adjoint Policy Optimization,平滑神经伴随策略优化),这是一个将神经策略嵌入已知可微仿真器中,用平滑近似替换硬约束,并在单次伴随过程中计算目标关于所有策略参数和所有输入的精确梯度的框架。我们在三个领域演示了 SNAPO:天然气储存(训练不到一分钟,365 条远期曲线敏感度无需每条敏感度额外计算成本)、养老基金资产负债管理(相比扰动重估法敏感度计算加速 6.5 倍至 200 倍,且随风险因子数量扩展),以及制药制造(贯穿 4 单元工艺链的跨单元敏感度,通过 5 次伴随过程在 74.5 毫秒内得出 20 项 ICH Q8 监管敏感度)。所有敏感度均由训练策略的同一反向过程产生,其成本与一次反向过程成正比,无论计算多少敏感度。

关键词

引用

@article{arxiv.2605.06570,
  title  = {SNAPO: Smooth Neural Adjoint Policy Optimization for Optimal Control via Differentiable Simulation},
  author = {Dmitri Goloubentsev and Natalija Karpichina},
  journal= {arXiv preprint arXiv:2605.06570},
  year   = {2026}
}

备注

27 pages, 8 tables. Three domains: natural gas storage, pension fund ALM, pharmaceutical manufacturing. Benchmark code and trained policies available on request