ChroKnowledge:揭示语言模型在多个领域的时序知识
计算与语言
2025-03-03 v3 人工智能
摘要
大型语言模型(LLM)已在我们生活的许多方面带来了显著变革。然而,评估和确保其时序知识仍具有挑战性。现有方法不足以解决知识的时序适应性,往往依赖固定时间点的观察。为此,我们引入 ChroKnowBench,这是一个设计用于评估跨多个领域、时序依赖性和时序状态下时序累积知识的基准数据集。我们的基准区分了随时间演化的知识(如个人历史、科学发现、修订法律)与保持不变的知识(如数学真理、常识事实)。基于该基准,我们提出 ChroKnowledge(时序知识的分类),这是一种新颖的基于抽样的框架,用于评估 LLM 的非参数时序知识。我们的评估得出以下观察结果:(1)模型在不同训练数据格式下,召唤时序知识的能力存在差异。(2)LLM 部分地记得知识或在时序边界处出现截断,而非正确地记住知识的所有方面。因此,我们应用 ChroKnowPrompt,即一种深入的提示技术,通过遍历周围时段来召唤时序知识。我们观察到,该方法成功地召唤了开源和专有 LLM 中的对象,显示出了 versatility,尽管其在动态数据集和非结构化格式方面面临挑战。
引用
@article{arxiv.2410.09870,
title = {ChroKnowledge: Unveiling Chronological Knowledge of Language Models in Multiple Domains},
author = {Yein Park and Chanwoong Yoon and Jungwoo Park and Donghyeon Lee and Minbyul Jeong and Jaewoo Kang},
journal= {arXiv preprint arXiv:2410.09870},
year = {2025}
}
备注
ICLR 2025, 40 pages, 17 figures