中文

大语言模型具有预见性吗?利用每日新闻作为神谕的持续评估

计算与语言 2025-07-09 v2 人工智能 机器学习

摘要

现有的大语言模型 (LLM) 评估基准因新模型和训练数据的出现而迅速过时。这些基准也难以评估 LLM 性能随时间的变化,因为它们由一组静态问题组成,缺乏时间维度。为解决这些局限,我们提出利用未来事件预测作为持续评估方法,以评估 LLM 的时间泛化和预测能力。我们的基准 Daily Oracle 从每日新闻自动生成问答 (QA) 对,挑战 LLM 预测“未来”事件结果。研究发现,随着预训练数据过时,LLM 性能随时间下降。虽然检索增强生成 (RAG) 有潜力提高预测准确性,但性能下降模式依然存在,凸显了持续模型更新的必要性。代码和数据可在 https://agenticlearning.ai/daily-oracle 获取。

关键词

引用

@article{arxiv.2411.08324,
  title  = {Are LLMs Prescient? A Continuous Evaluation using Daily News as the Oracle},
  author = {Hui Dai and Ryan Teehan and Mengye Ren},
  journal= {arXiv preprint arXiv:2411.08324},
  year   = {2025}
}

备注

ICML 2025