中文

基于分类器模型的集成强化学习:增强交易策略的风险-收益权衡

机器学习 2026-05-21 v2 人工智能 计算金融 机器学习

摘要

本文提出了一项关于在金融交易策略中使用集成强化学习(RL)模型的综合研究,利用分类器模型来提升性能。通过将 A2C、PPO 和 SAC 等 RL 算法与支持向量机(SVM)、决策树和逻辑回归等传统分类器相结合,我们研究了如何集成不同的分类器组以改善风险-收益权衡。该研究评估了各种集成方法的有效性,并在关键金融指标上将其与单个 RL 模型进行了比较,这些指标包括累计收益、夏普比率(SR)、卡玛比率和最大回撤(MDD)。我们的结果表明,集成方法在风险调整收益方面始终优于基础模型,能够更好地管理回撤并保持整体稳定性。然而,我们发现集成性能对方差阈值 {\tau} 的选择很敏感,强调了动态调整 {\tau} 以实现最佳性能的重要性。本研究强调了将 RL 与分类器相结合以实现自适应决策的价值,对金融交易、机器人技术及其他动态环境具有启示意义。

关键词

引用

@article{arxiv.2502.17518,
  title  = {Ensemble RL through Classifier Models: Enhancing Risk-Return Trade-offs in Trading Strategies},
  author = {Zheli Xiong},
  journal= {arXiv preprint arXiv:2502.17518},
  year   = {2026}
}

备注

16 pages,5 figures, 1 table