用于描述性字幕生成的时间序列语言模型
计算与语言
2025-01-06 v1 机器学习
摘要
自动生成时间序列数据中可观测模式的代表性自然语言描述,可增强可解释性、简化分析并提高时间数据的跨领域效用。尽管预训练基础模型在自然语言处理 (NLP) 和计算机视觉 (CV) 方面取得了显著进展,但数据稀缺阻碍了其在时间序列分析中的应用。尽管已有若干基于大型语言模型 (LLM) 的时间序列预测方法被提出,但在 LLM 语境下时间序列字幕生成仍鲜有探索。在本文中,我们介绍了 TSLM,一种专为时间序列字幕生成设计的新型时间序列语言模型。TSLM 作为编码器-解码器模型运行,利用文本提示和时间序列数据表示,捕捉多个阶段的细微时间模式,并生成时间序列输入的精确文本描述。TSLM 通过首先利用上下文提示合成数据生成,其次对生成数据进行应用于时间序列-字幕对的新型跨模态密集检索评分去噪,从而解决了时间序列字幕生成中的数据稀缺问题。在多个时间序列字幕数据集上的实验结果表明,TSLM 以显著优势优于来自多种数据模态的现有 SOTA 方法。
引用
@article{arxiv.2501.01832,
title = {Time Series Language Model for Descriptive Caption Generation},
author = {Mohamed Trabelsi and Aidan Boyd and Jin Cao and Huseyin Uzunalioglu},
journal= {arXiv preprint arXiv:2501.01832},
year = {2025}
}