中文

你的 LLM 过时了吗?深入探讨时间泛化

计算与语言 2025-07-02 v3 人工智能

摘要

Large Language Models (LLMs) 的快速发展推动了考虑时间动态的基准测试的开发,然而,由于语言和信息的固有动态特性,在理解这些模型在不同时间上下文中的泛化能力方面仍存在差距。本文引入了 LLM 中时间泛化的概念,包括过去泛化和未来泛化中的偏差。随后我们介绍了 FreshBench,这是一个新的评估框架,采用新鲜文本和事件预测来评估 LLM 的时间适应性,确保评估过程免受数据泄露和主观偏差的影响。实验显示了显著的时间偏差以及性能随时间的下降。我们的发现表明,强大的模型虽然最初表现优越,但在未来泛化中下降得更快。此外,与闭源模型相比,强大的开源模型表现出更好的长期适应性。我们的代码可在 https://github.com/FreedomIntelligence/FreshBench 获取。

关键词

引用

@article{arxiv.2405.08460,
  title  = {Is Your LLM Outdated? A Deep Look at Temporal Generalization},
  author = {Chenghao Zhu and Nuo Chen and Yufei Gao and Yunyi Zhang and Prayag Tiwari and Benyou Wang},
  journal= {arXiv preprint arXiv:2405.08460},
  year   = {2025}
}

备注

NAACL 2025 Oral