中文

ITGPT:面向不规则时序数据的生成式预训练

机器学习 2026-05-18 v1

摘要

时序回归模型往往难以利用大量标记的多模态数据,尤其是在数据不规则采样或包含缺失值的情况下。这在医疗和预测性维护等领域尤为常见,因为数据来自不可靠的来源,标记需要专家知识或昂贵的设备。基于自监督学习(SSL)和生成式预训练(GPT)框架,基于Transformer的大型语言模型在结构化数据如文本方面表现良好。然而,这类模型缺乏灵活性,无法高效处理不规则采样的多模态时序数据。本文引入ITGPT,一种基于注意力机制的架构,专为处理多模态、不规则采样的时序数据而设计,允许同时使用SSL损失和GPT类目标进行训练。我们在医疗任务上使用TIHM数据集,并在预测性维护任务上使用CompX数据集进行评估。我们的结果表明,ITGPT在无需重采样、特征融合或显式数据插补的情况下,即可实现最先进的性能;此外,在标签稀缺时,ITGPT通过SSL和GPT训练有效地利用未标记数据,超越纯监督方法。ITGPT的成功表明,未来有望高效利用大规模非结构化时序数据集以实现实际推理任务。

关键词

引用

@article{arxiv.2605.16069,
  title  = {ITGPT: Generative Pretraining on Irregular Timeseries},
  author = {Antoine Honoré and Ming Xiao},
  journal= {arXiv preprint arXiv:2605.16069},
  year   = {2026}
}

备注

9 pages