面向金融应用的时间非齐次波动性回避
计算金融
2026-02-13 v1 交易与市场微观结构
摘要
在金融领域,常面临序列决策问题,强化学习(RL)因无需解析可行性而成为优化的有前景的工具。然而,经典 RL 的目标是累计奖励的期望值,而金融应用通常需要在收益与风险之间进行权衡。本文聚焦于关注总收益的时间分布划分的情形,这排除了大多数关注累计奖励风险度量的风险感知 RL 泛化方法。我们注意到,对均匀划分的偏好在对冲时令人满意,但在其他问题中可能不合适,因此我们提出了一种新的风险度量,仍对单个奖励的不确定性进行惩罚,但允许对其目标水平进行任意规划。我们研究了该目标的性质以及优化其的学习算法的通用性。最后,我们在 toy 示例中展示了数值结果。
引用
@article{arxiv.2602.12030,
title = {Time-Inhomogeneous Volatility Aversion for Financial Applications of Reinforcement Learning},
author = {Federico Cacciamani and Roberto Daluiso and Marco Pinciroli and Michele Trapletti and Edoardo Vittori},
journal= {arXiv preprint arXiv:2602.12030},
year = {2026}
}
备注
18 pages, 6 figures