基于二次变分惩罚的连续时间风险敏感强化学习
机器学习
2026-03-17 v2 系统与控制
系统与控制
计算金融
投资组合管理
摘要
本文研究了在熵正则化探索性扩散过程表述下、以指数形式为目标的连续时间风险敏感强化学习 (RL)。风险敏感目标源于智能体的风险态度,或作为应对模型不确定性的分布鲁棒方法。基于 Jia 和 Zhou (J Mach Learn Res 24(161): 1--61, 2023) 的鞅视角,风险敏感 RL 问题被证明等价于确保一个涉及价值函数和 q 函数的过程的鞅性质,并增加了一个额外的惩罚项:价值过程的二次变分,用于刻画沿轨迹的待达价值 (value-to-go) 的变异性。这一特征使得只需加入价值过程的已实现方差,即可将针对非风险敏感场景开发的现有 RL 算法直接改造以纳入风险敏感性。此外,我强调由于二次变分的非线性特性,传统的策略梯度表示不适用于风险敏感问题;然而,q-learning 提供了一种解决方案,并可扩展至无限时间视界设定。最后,我证明了所提算法在 Merton 投资问题上的收敛性,并量化了温度参数对学习过程行为的影响。我还进行了仿真实验,以展示风险敏感 RL 如何提升线性二次控制问题中的有限样本性能。
引用
@article{arxiv.2404.12598,
title = {Continuous-time Risk-sensitive Reinforcement Learning via Quadratic Variation Penalty},
author = {Yanwei Jia},
journal= {arXiv preprint arXiv:2404.12598},
year = {2026}
}
备注
54 pages, 2 figures, 1 table