利用强化学习引导时间序列分析的链式思维推理
机器学习
2026-03-17 v2
摘要
复杂的数值时间序列分析往往需要超越当前模型能力的多步骤推理能力。诸如医学诊断和天气预报等任务都要求进行顺序推理过程,包括反事实分析、逻辑推理、知识应用和多模态情境整合,而现有时间序列模型无法显式地执行这些操作。虽然近期研究表明,大语言模型(LLM)可以通过强化学习(RL)实现 sophisticated 链式思维(CoT)推理,但这些进展主要集中在数学和编码领域,LLM 在时间序列任务上仍表现不佳。我们引入 Chain Of thought for Understanding Numerical Time Series(COUNTS),这是第一个在 RL 中利用可验证奖励训练 LLM 进行跨多样化时间序列任务 CoT 推理的框架。我们的方法采用残差向量量化变分自编码器(Residual Vector-Quantized VAE),创建高保真离散标记,无缝集成到预训练 LLM 的词汇表中。COUNTS 采用两阶段训练流程:首先在时间序列分析任务上进行监督微调,以掌握我们新颖的表示方法,随后在可验证问题上使用 Group Relative Policy Optimization 训练,采用鼓励在生成最终答案前显式推理步骤的提示策略。我们的实验表明,带有中间 CoT 推理的 RL 方法显著提升了 LLM 在各种时间序列分析任务上的性能,为复杂时序数据推理开辟了新可能。
引用
@article{arxiv.2510.01116,
title = {Eliciting Chain-of-Thought Reasoning for Time Series Analysis using Reinforcement Learning},
author = {Felix Parker and Nimeesha Chan and Chi Zhang and Kimia Ghobadi},
journal= {arXiv preprint arXiv:2510.01116},
year = {2026}
}