中文

当基准年老:大语言模型事实性评估中的时间错位

计算与语言 2026-01-21 v2

摘要

大语言模型 (LLM) 的快速演进以及现实世界的不断变化,已超越广泛使用的评估基准的静态特性,引发对其可靠性的潜在疑虑。尽管大量研究仍依赖流行但陈旧的基准,然而这些基准与现实事实以及现代 LLM 之间的时间错位,以及其对 LLM 事实性评估的影响尚未得到充分探讨。因此,本文系统性地调查了这一问题,通过考察五个流行的事实性基准和跨不同年份发布的八个 LLM。我们构建了时效的事实检索管道,并量化基准老化及其对 LLM 事实性评估的影响。实验结果和分析表明,事实性基准中相当比例的样本已过时,导致对 LLM 事实性评估不可靠。我们希望本工作能为评估 LLM 事实性基准的可靠性提供测试平台,并激发更多关于基准老化问题的研究。代码已公开于 https://github.com/JiangXunyi/BenchAge。

关键词

引用

@article{arxiv.2510.07238,
  title  = {When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation},
  author = {Xunyi Jiang and Dingyi Chang and Julian McAuley and Xin Xu},
  journal= {arXiv preprint arXiv:2510.07238},
  year   = {2026}
}

备注

Accepted to EACL 2026 Main Conference