中文

评估大型语言模型在时间序列特征理解方面的能力:综合分类学与基准

计算与语言 2024-10-10 v2

摘要

大型语言模型(LLMs)为自动化的时间序列分析与报告提供了潜力,这是跨越医疗保健、金融、气候、能源等众多领域的关键任务。本文提出了一个框架,用于严格评估LLMs在时间序列理解方面的能力,涵盖单变量和多变量形式。我们引入了时间序列特征的全面分类学,这是一个关键框架,界定了时间序列数据中各种内在特征。借助该分类学,我们系统地设计并合成了包含不同特征的时间序列数据集,每个数据集都伴随文本描述。该数据集为评估LLMs理解时间序列的熟练程度提供了坚实的基础。我们的实验揭示了最新技术LLMs在时间序列理解方面的优势与局限,揭示了这些模型在哪些特征上能够有效理解,以及在哪些地方存在挑战。此外,我们还发现LLMs对数据格式、查询点在序列中的位置以及整体时间序列长度等因素的敏感性。

关键词

引用

@article{arxiv.2404.16563,
  title  = {Evaluating Large Language Models on Time Series Feature Understanding: A Comprehensive Taxonomy and Benchmark},
  author = {Elizabeth Fons and Rachneet Kaur and Soham Palande and Zhen Zeng and Tucker Balch and Manuela Veloso and Svitlana Vyetrenko},
  journal= {arXiv preprint arXiv:2404.16563},
  year   = {2024}
}

备注

Accepted to EMNLP 2024