中文

T2S:基于文本到系列扩散模型的高分辨率时间序列生成

机器学习 2025-05-09 v2 人工智能

摘要

文本到时间序列生成具有显著的潜力,旨在解决数据稀疏、不平衡以及跨领域多模态时间序列数据稀缺等挑战。虽然扩散模型在文本到-X(如视觉和音频数据)生成方面取得了显著成功,但其在时间序列生成中的应用仍处于初步阶段。现有方法面临两个关键局限:(1)缺乏对通用时序描述的系统性探索,这些描述常为领域特定,难以泛化;(2)无法生成任意长度的时间序列,限制了其在实际场景中的应用。在本工作中,我们首先将时序描述分为三个层次:点级、片段级和实例级。此外,我们引入了一个包含超过60万个高分辨率时序-文本对的新型片段级数据集。其次,我们提出了文本到系列(T2S),一个基于扩散的框架,以领域无关的方式搭建自然语言与时序数据之间的鸿沟。T2S采用可变长度变分自编码器,将不同长度的时序数据编码为一致的潜在嵌入。此外,T2S通过流匹配(Flow Matching)有效地将文本表示与潜在嵌入对齐,并采用扩散变换器作为去噪器。我们以交叉式训练范式进行训练,跨越多个长度,使其能够生成任意所需长度的序列。广泛的评估表明,T2S在横跨12个领域的13个数据集上实现了最先进的性能。

关键词

引用

@article{arxiv.2505.02417,
  title  = {T2S: High-resolution Time Series Generation with Text-to-Series Diffusion Models},
  author = {Yunfeng Ge and Jiawei Li and Yiji Zhao and Haomin Wen and Zhao Li and Meikang Qiu and Hongyan Li and Ming Jin and Shirui Pan},
  journal= {arXiv preprint arXiv:2505.02417},
  year   = {2025}
}

备注

Accepted by the 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)