TiMoE:时间感知的语言专家混合模型
计算与语言
2025-08-13 v1
摘要
大型语言模型(LLMs)通常在固定的网络快照上进行训练,这意味着它们的知识会变得陈旧,其预测存在时间泄漏的风险:即依赖于相对于查询时间点而言属于未来的信息。我们通过在一个2013-2024年语料库的不相交两年切片上从头预训练一组GPT风格的专家模型,并通过TiMoE(一种时间感知的语言专家混合模型)将它们组合起来,来解决这个问题。在推理时,TiMoE会屏蔽所有训练窗口结束时间晚于查询时间戳的专家,并在一个共享空间中合并剩余的对数概率,从而在保证严格因果有效性的同时,保留了多时期知识的广度。我们还发布了TSQA,这是一个包含1万个问题的基准测试,其备选答案被明确标记为过去、未来或不相关,允许对时间幻觉进行细粒度测量。在八个标准自然语言处理任务以及TSQA上的实验表明,一种协同适应的TiMoE变体能够匹配或超越最佳的单时期专家,并将未来知识错误最多减少15%。我们的结果表明,模块化、时间分段的预训练与因果路由相结合,是一条简单而有效的路径,能够使大型语言模型在不牺牲太多通用性能的情况下保持时间上的准确性。我们在TiMoE(Github)上开源了代码:https://github.com/epfml/TiMoE
引用
@article{arxiv.2508.08827,
title = {TiMoE: Time-Aware Mixture of Language Experts},
author = {Robin Faro and Dongyang Fan and Tamar Alphaidze and Martin Jaggi},
journal= {arXiv preprint arXiv:2508.08827},
year = {2025}
}