基于大语言模型的时间序列建模中的时间分词策略
计算与语言
2026-05-12 v3 机器学习
摘要
在利用大语言模型(LLMs)建模时序事件序列的表示连续时间是一个关键且鲜有探索的挑战。已提出 various 策略,如字节级表示或日历标记。然而,最佳方法仍不明确,尤其考虑到现实事件数据呈现多样的统计分布,从平滑的对数正态分布到离散的尖峰模式。本文进行了一项系统的经验研究,比较了时间分词在LLMs中建模事件序列的不同编码策略:朴素的数字字符串、高精度字节级表示、人类语义日历标记、经典的均匀分箱和自适应残差标量量化。我们通过在体现这些多样分布的真实数据集上微调LLMs来评估这些策略。我们的分析表明,没有单一策略在所有情况下都优于完美;相反,预测性能高度依赖于分词器与数据统计特性之间的匹配,这一发现凸显了时间分词作为LLM基于事件建模中往往被忽视的关键设计维度。
引用
@article{arxiv.2512.13618,
title = {Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models},
author = {Zefang Liu and Nam H. Nguyen and Yinzhu Quan and Shi-Xiong Zhang},
journal= {arXiv preprint arXiv:2512.13618},
year = {2026}
}