小词汇表,大收益:时间序列模型中的预训练与分词
机器学习
2025-11-18 v1 人工智能
计算与语言
摘要
分词和迁移学习是构建面向时间序列预测的最先进基础模型的两个关键组件。本文系统性地研究了分词器设计(具体而言是规模和量化策略)对模型性能的影响,以及预训练相对于随机初始化的影响。我们表明,分词器配置主要决定模型的表征能力和稳定性,而迁移学习影响优化效率和对齐方式。通过结合经验训练实验和理论分析,我们展示,预训练模型在使用良好设计的分词器时能更有效地利用,尤其是在较小词汇表大小时效果尤为突出。相反,误配的分词可能削弱甚至反转预训练的优势。这一发现凸显了在时间序列建模中谨慎分词的重要性,并表明在多模态预测设置中,结合小而高效的词汇表与预训练权重尤为有利,因为整体词汇表必须跨模态共享。我们的结果为在离散表示学习中为连续信号设计分词器和利用迁移学习提供了具体指导。
引用
@article{arxiv.2511.11622,
title = {Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models},
author = {Alexis Roger and Gwen Legate and Kashif Rasul and Yuriy Nevmyvaka and Irina Rish},
journal= {arXiv preprint arXiv:2511.11622},
year = {2025}
}