中文

大型语言模型的时间意识:跨时间的事实记忆基准测试

计算与语言 2025-05-16 v3 人工智能

摘要

美国总统是谁?答案取决于提问的时间。尽管大型语言模型(LLMs)在各种推理任务上进行评估,但常常忽视了一个关键维度:时间。在现实场景中,答案的正确性常常依赖于时间背景。为填补这一差距,我们提出了新的框架和数据集,涵盖2018年至2024年间的8000多件事件,按日粒度标注,来源于政治、科学、商业等多个领域。我们的TimeShift评估方法系统性地探测LLMs的时间推理能力,发现基线模型在时间敏感记忆方面往往优于指令调优和合成训练的模型。此外,我们发现即便是大规模模型在处理改写事实时也表现脆弱,这凸显了时间一致性仍面临的挑战。通过识别这些局限性,我们的工作为推进具备适应现实世界知识动态性特征的时间感知语言模型迈出了重要一步。

关键词

引用

@article{arxiv.2409.13338,
  title  = {Time Awareness in Large Language Models: Benchmarking Fact Recall Across Time},
  author = {David Herel and Vojtech Bartek and Jiri Jirak and Tomas Mikolov},
  journal= {arXiv preprint arXiv:2409.13338},
  year   = {2025}
}