中文

Time-MQA:基于上下文增强的时间序列多任务问答

计算与语言 2025-07-01 v2 人工智能 机器学习

摘要

时间序列数据是金融、医疗和能源等领域的基础数据。然而,现有大多数方法和数据集仍集中于预测或异常检测等有限范围的任务。为弥合这一差距,我们引入时间序列多任务问答(Time-MQA),一个统一框架,使其能够通过自然语言查询跨越多个时间序列任务——包括数值分析任务和具有推理能力的开放式问答。Time-MQA 的核心是 TSQA 数据集,一个包含约 20 万个问答对的大规模数据集,源自涵盖环境、交通等多样化时间序列数据。该综合资源涵盖各种时间序列长度,促进稳健的模型开发。我们进一步展示了如何通过在 TSQA 数据集上持续预训练大型语言模型(如 Mistral 7B、Llama-3 8B 和 Qwen-2.5 7B),以提升时间序列推理能力,超越单纯的数值任务,实现与时序数据的更高级和直观的交互。完整的 TSQA 数据集、模型、用于评估的用户研究问卷以及其他相关材料已开源。

关键词

引用

@article{arxiv.2503.01875,
  title  = {Time-MQA: Time Series Multi-Task Question Answering with Context Enhancement},
  author = {Yaxuan Kong and Yiyuan Yang and Yoontae Hwang and Wenjie Du and Stefan Zohren and Zhangyang Wang and Ming Jin and Qingsong Wen},
  journal= {arXiv preprint arXiv:2503.01875},
  year   = {2025}
}

备注

Annual Meeting of the Association for Computational Linguistics (ACL 2025, Main)