TiEBe:追踪语言模型对全球著名事件随时间推移的回忆
计算与语言
2025-05-21 v2 人工智能
摘要
随着知识格局的演变和大语言模型(LLM)日益普及,保持这些模型与当前事件同步的需求日益增长。虽然现有基准评估一般性事实回忆,但很少有研究探讨 LLM 如何随时间或跨不同区域保留知识。为弥补这些空白,我们提出了及时事件基准(TiEBe),这是一个包含超过 23,000 个问答对的数据集,聚焦于著名的全球和区域事件,涵盖超过 10 年的事件、23 个区域和 13 种语言。TiEBe 利用来自 Wikipedia 的结构化回顾性数据来识别随时间推移的著名事件。然后使用这些事件构建基准,以评估 LLM 对全球和区域发展的理解,其基础是 Wikipedia 之外的事实证据。我们的结果揭示了事实回忆中显著的地理差异,强调了在 LLM 训练中需要更平衡的全球代表性。我们还观察到模型在 TiEBe 中的表现与各国社会经济指标(如 HDI)之间的 Pearson 相关系数超过 0.7。此外,我们通过用每个事件发生地区的母语提出问题来考察语言对事实回忆的影响,揭示了低资源语言的显著性能差距。
引用
@article{arxiv.2501.07482,
title = {TiEBe: Tracking Language Model Recall of Notable Worldwide Events Through Time},
author = {Thales Sales Almeida and Giovana Kerche Bonás and João Guilherme Alves Santos and Hugo Abonizio and Rodrigo Nogueira},
journal= {arXiv preprint arXiv:2501.07482},
year = {2025}
}