预期强化学习:从生成路径律到分布值函数
机器学习
2026-04-07 v1 数理金融
证券定价
统计金融
摘要
本文提出预期强化学习(ARL),一个旨在弥合非马尔可夫决策过程与经典强化学习架构之间差距的新型框架,具体约束为单条观测轨迹。在具有跳跃扩散和结构断裂的环境中,传统基于状态的方法往往无法捕获准确预测所需的本质路径依赖几何。我们通过将状态空间提升到签名增强流形来解决此问题,其中过程的历史被嵌入为动力学坐标。通过利用自洽场方法,智能体维护对未来路径律的预期代理,从而实现对期望回报的确定性评估。这一从随机分支到单次线性评估的转变显著降低了计算复杂度和方差。我们证明该框架保持了基本的压缩性质,并确保在重尾噪声存在下仍能稳定泛化。我们的结果表明,通过将强化学习建立在路径空间的拓扑特征之上,智能体可以在高度波动的连续时间环境中实现主动风险管理和优越的策略稳定性。
引用
@article{arxiv.2604.04662,
title = {Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions},
author = {Daniel Bloch},
journal= {arXiv preprint arXiv:2604.04662},
year = {2026}
}