ScienceMeter:追踪语言模型中的科学知识更新
计算与语言
2025-07-01 v2
摘要
大型语言模型 (LLM) 越来越多地被用于支持科学研究,但它们对科学进步的知识可能很快过时。我们引入了 ScienceMeter,一个用于评估跨越过去、现在和未来的科学知识更新方法的新框架。ScienceMeter 定义了三个指标:知识保持,即模型对先前学习论文的理解得以保持的程度;知识获取,即新引入论文中的科学主张被获取的程度;以及知识预测,即更新后的模型预测或泛化到未来可能出现的相关科学主张的能力。使用 ScienceMeter,我们在主张判断与生成任务上,跨越包含医学、生物学、材料科学和计算机科学等十个领域的 15,444 篇科学论文和 30,888 条科学主张的精选数据集,考察了 LLM 的科学知识。我们评估了五种代表性的知识更新方法,包括训练时和推理时方法。通过大量实验,我们发现表现最好的知识更新方法仅能保持 85.9% 的现有知识,获取 71.7% 的新知识,并预测 37.7% 的未来知识。基于推理的方法适用于较大的模型,而较小的模型则需要训练才能达到相当的性能。跨领域分析表明,在这些目标上的表现是相关的。即使应用于专门的科学 LLM,现有的知识更新方法也无法共同实现这些目标,这凸显了开发稳健的科学知识更新机制既至关重要又充满挑战。
引用
@article{arxiv.2505.24302,
title = {ScienceMeter: Tracking Scientific Knowledge Updates in Language Models},
author = {Yike Wang and Shangbin Feng and Yulia Tsvetkov and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2505.24302},
year = {2025}
}