当事实改变:通过 evolveQA 检验 LLM 对动态知识的理解
计算与语言
2025-11-18 v2 人工智能
摘要
大语言模型往往无法处理时序知识冲突——即在其训练数据中随时间演变的事实产生的矛盾。现有研究通过基于结构化知识库(如 Wikidata)构建的基准测试来评估这一现象,但它们聚焦于覆盖面广、易记忆的热门实体,缺乏针对不同知识截止日期的 LLM进行公正评估所需的动态结构。我们提出 evolveQA,一个专为评估 LLM 对时序演变知识而设计的基准测试,由 3 个真实世界、带时间戳的语料库构成:AWS 更新、Azure 变更和 WHO 疾病 outbreak 报告。我们的框架识别自然发生的知识演变,并生成针对不同 LLM 知识截止日期的金标准答案的问题。通过对 12 个开源和闭源 LLM 在 3 种知识探测格式中的广泛评估,我们展示了相对于静态知识问题,evolveQA 上性能可下降最高 31%。
引用
@article{arxiv.2510.19172,
title = {When Facts Change: Probing LLMs on Evolving Knowledge with evolveQA},
author = {Nishanth Sridhar Nakshatri and Shamik Roy and Manoj Ghuhan Arivazhagan and Hanhan Zhou and Vinayshekhar Bannihatti Kumar and Rashmi Gangadharaiah},
journal= {arXiv preprint arXiv:2510.19172},
year = {2025}
}
备注
Under submission