中文

DatedGPT:面向金融时间序列的大语言模型防范前瞻偏差

计算与语言 2026-03-13 v1 综合金融

摘要

在金融回测中,预训练于互联网规模数据的大语言模型风险引入前瞻偏差,削弱其预测有效性,因为模型可能在训练期间已见真实结果。为此,我们提出DatedGPT,一套十二个13亿参数的语言模型,每个模型均基于约1000亿token的时间分区数据从头训练,时间范围覆盖2013至2024年,严格采用年度截止点。我们进一步对每个模型进行指令微调,使用为尊重相同时间边界而精选的通用领域和金融专用数据集。基于困惑度的探测确认,每个模型的知识实际受限于其数据截止年份,而标准基准测试的评估显示其性能与同规模现有模型相当。我们提供了一个交互式网页演示,允许用户查询并比较不同截止年份模型的响应。

关键词

引用

@article{arxiv.2603.11838,
  title  = {DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining},
  author = {Yutong Yan and Raphael Tang and Zhenyu Gao and Wenxi Jiang and Yao Lu},
  journal= {arXiv preprint arXiv:2603.11838},
  year   = {2026}
}