中文

面向时间序列问答的链式思考评审与纠正

计算与语言 2025-12-30 v1

摘要

随着大型语言模型(LLM)的发展,各种时间序列分析任务都通过统一的自然语言界面被重新表述为时间序列问答(TSQA)。然而,现有的基于LLM的方法大多采用通用的自然语言处理技术,在处理复杂数值序列时容易出现推理错误。与纯文本任务不同,时间序列数据具有内在的可验证性,能够在推理步骤与原始输入之间进行一致性检查。基于这一属性,我们提出了T3LLM框架,通过显式的纠正机制实现多步骤推理,以提高时间序列问答的性能。T3LLM框架由三个LLM组成,分别负责生成、评审和推理学习。在该框架内部,工作者在结构化提示下生成逐步的思考链(CoT),而评审者则检查推理过程,识别错误步骤并提供纠正意见。协同生成的纠正后CoT用于微调学生模型,将多步骤推理和自我纠正内化为模型参数。在多个真实世界TSQA基准测试上的实验表明,T3LLM在强大的基于LLM的基线方法上实现了最先进的性能。

关键词

引用

@article{arxiv.2512.22627,
  title  = {Chain-of-thought Reviewing and Correction for Time Series Question Answering},
  author = {Chen Su and Yuanhe Tian and Yan Song},
  journal= {arXiv preprint arXiv:2512.22627},
  year   = {2025}
}