基于可验证预测动作的推理:面向金融 LLM 的一致性驱动强化学习
机器学习
2026-05-22 v1
摘要
金融市场以极端非平稳性、低信噪比以及对外部信息(如新闻、公司基本面和宏观经济信号)的强依赖性著称。然而,现有方法要么将时间序列抽象为文本,要么将预测与语言推理分离,导致定性推理与定量结果之间存在根本性不匹配。为此,我们引入了 StockR1,这是一个融合了时间序列增强技术的 LLM,通过可验证的预测动作统一了股票预测与金融推理。在工具调用设计下,该模型首先发出预测动作,这是一种对其定性市场展望的结构化且可解释的表示;随后,它调用以该动作为条件的时间序列解码器,以生成分布式的未来轨迹,从而实现更有信息量的问答和金融推理。我们通过强化学习优化整个流程,其中奖励函数同时反映答案的有效性、预测准确性以及生成动作与观察到的时间序列动态之间的一致性。此外,奖励函数按样本级别的不确定性标量进行重新加权,鼓励模型适应市场动态中不同的不确定性水平。我们在大型 10 年基准测试上评估了 StockR1,针对金融问答和股票预测进行测试。我们的方法在时间序列基线和通用 LLM 方面均表现出色,分别将推理准确率提升了 17.7%(4B 参数)和 25.9%(8B 参数)。这些发现表明,构建预测动作的结构化形式在语言推理与时序预测之间建立了强大的协同效应,使 LLM 能够通过可验证、可解释且数值支撑的决策进行推理。
引用
@article{arxiv.2605.21975,
title = {Reasoning through Verifiable Forecast Actions: Consistency-Grounded RL for Financial LLMs},
author = {Jialin Chen and Aosong Feng and Harshit Verma and Siyi Gu and Haiwen Wang and Ali Maatouk and Yixuan He and Yifeng Gao and Leandros Tassiulas and Rex Ying},
journal= {arXiv preprint arXiv:2605.21975},
year = {2026}
}