DeepSeekMath 遇上订单簿:基于组注意的高频方向性交易策略优化
机器学习
2026-05-26 v1 计算工程、金融与科学
摘要
本文研究基于订单流状态模型与策略梯度方法的高频交易中强化学习。本文不采用表格 Q 学习等基于价值的 RL 技术,而是部署基于策略的方法,如 vanilla PPO 以及受 DeepSeekMath 启发的变体 GRPO 与 GSPO,这些方法使用组归一化更新和逆势感知塑形。在基于 AMZN、AAPL 和 GOOG 财务资产的回测测试中,采用以价差比例缩放奖励的简化回测 setup 下,这些新策略在净平均盈亏、盈利能力和回撤方面均优于 Q-Learning 基线。我们的结果表明:(1)订单流信号是策略 RL 充分的状态;(2)基于组注意的 PPO 近似方法优于基于价值的基线方法。
引用
@article{arxiv.2605.25527,
title = {DeepSeekMath Meets Order Book: Group-Aware Policy Optimization for High-Frequency Directional Trading},
author = {Sayak Charabarty and Souradip Pal},
journal= {arXiv preprint arXiv:2605.25527},
year = {2026}
}
备注
9 pages, 3 figures