中文

面向金融交易的风险感知强化学习奖励函数

机器学习 2025-06-06 v1

摘要

我们提出了一种用于金融交易的强化学习新型复合奖励函数,通过四个可微项平衡收益与风险:年化收益、下行风险、差分收益和 Treynor 比率。不同于单一指标目标(例如夏普比率),我们的 formulation 模块化且由权重 w1 w2 w3 和 w4 参数化,使实践者能够编码多样化的投资者偏好。我们通过网格搜索调整这些权重以针对特定的风险-收益轮廓进行调优。我们为每个术语推导闭式梯度,以便进行基于梯度的训练,并分析关键理论属性,包括单调性、有界性和模块性。这一框架为在复杂交易环境中构建稳健的多目标奖励函数提供了通用蓝图,可扩展以添加额外的风险措施或自适应加权。

关键词

引用

@article{arxiv.2506.04358,
  title  = {A Risk-Aware Reinforcement Learning Reward for Financial Trading},
  author = {Uditansh Srivastava and Shivam Aryan and Shaurya Singh},
  journal= {arXiv preprint arXiv:2506.04358},
  year   = {2025}
}

备注

14 pages, 11 figures