中文

Trade-R1:通过过程级推理验证将可验证奖励桥接到随机环境

人工智能 2026-01-09 v2 交易与市场微观结构

摘要

强化学习 (RL) 已使大型语言模型 (LLM) 在数学和编码等领域实现了显著的推理能力,其中可验证奖励提供清晰信号。然而,将这一范式扩展到金融决策面临挑战,因为市场具有随机特性:奖励虽可验证但本质上噪声较大,导致标准 RL 退化为奖励攻击。为此,我们提出 Trade-R1,一种通过过程级推理验证将可验证奖励桥接到随机环境的模型训练框架。我们的关键创新是一种将评估长篇金融文件推理问题转化为结构化检索增强生成 (RAG) 任务的验证方法。我们构建三角一致性指标,评估检索证据、推理链与决策之间的两两对齐情况,以作为噪声市场收益的有效性过滤器。我们探索两种奖励集成策略:Fixed-effect Semantic Reward (FSR) 用于稳定的对齐信号,Dynamic-effect Semantic Reward (DSR) 用于耦合幅度优化。在不同国家资产选择实验中,我们的方法显著减少了奖励攻击,其中 DSR 实现了最佳的跨市场泛化能力,同时保持最高的推理一致性。

关键词

引用

@article{arxiv.2601.03948,
  title  = {Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification},
  author = {Rui Sun and Yifan Sun and Sheng Xu and Li Zhao and Jing Li and Daxin Jiang and Cheng Hua and Zuo Bai},
  journal= {arXiv preprint arXiv:2601.03948},
  year   = {2026}
}