中文

TimeSeriesExam:一项时间序列理解测试

人工智能 2024-10-22 v1 计算与语言

摘要

大型语言模型(LLM)最近展现出了对时间序列数据进行建模的卓越能力。如果LLM理解基本的时间序列概念,这些能力可以得到部分解释。然而,我们对这些模型关于时间序列数据理解程度的了解仍然相对有限。为了解决这一差距,我们引入了TimeSeriesExam,一个可配置且可扩展的多项选择题测试,旨在评估LLM在五个核心时间序列理解类别上的能力:模式识别、噪声理解、相似性分析、异常检测和因果分析。TimeSeriesExam包含超过700个问题,这些问题使用104个精心设计的模板程序化生成,并经过迭代优化以平衡难度和区分好坏模型的能力。我们在TimeSeriesExam上测试了7个最先进的LLM,并首次对其时间序列理解能力进行了全面评估。我们的结果表明,像GPT-4和Gemini这样的闭源模型对简单时间序列概念的理解明显优于其开源对应模型,而所有模型在处理因果分析等复杂概念时都表现挣扎。我们认为,能够程序化生成问题是评估和提高LLM理解与推理时间序列数据能力的基础。

关键词

引用

@article{arxiv.2410.14752,
  title  = {TimeSeriesExam: A time series understanding exam},
  author = {Yifu Cai and Arjun Choudhry and Mononito Goswami and Artur Dubrawski},
  journal= {arXiv preprint arXiv:2410.14752},
  year   = {2024}
}

备注

Accepted at NeurIPS'24 Time Series in the Age of Large Models Workshop