NewTerm:针对大型语言模型年度更新实时新词的基准测试
计算与语言
2024-10-29 v1
摘要
尽管大型语言模型 (LLMs) 在各种任务中表现出卓越的能力,但由于其开发过程中存在的知识截止问题,它们在处理实时信息(例如新事实和新词)时仍然面临困难。然而,现有的基准测试侧重于过时的内容和有限的领域,在实时更新方面面临困难,且未对新词进行探索。为了解决这个问题,我们提出了一个自适应的基准测试 NewTerm,用于对新词进行实时评估。我们设计了一种高度自动化的构建方法,以确保在最少人工干预下构建高质量的基准测试,并允许对实时信息进行灵活更新。在各种 LLMs 上的实证结果表明,新词会导致超过 20% 的性能下降。此外,虽然更新 LLMs 的知识截止日期可以覆盖部分新词,但它们无法泛化到更久远的新词。我们还分析了哪些类型的词更具挑战性以及为什么 LLMs 难以处理新词,为未来的研究铺平了道路。最后,我们构建了 NewTerm 2022 和 2023 以评估每年更新的新词,并将继续每年更新。该基准测试和代码可在 https://github.com/hexuandeng/NewTerm 找到。
引用
@article{arxiv.2410.20814,
title = {NewTerm: Benchmarking Real-Time New Terms for Large Language Models with Annual Updates},
author = {Hexuan Deng and Wenxiang Jiao and Xuebo Liu and Min Zhang and Zhaopeng Tu},
journal= {arXiv preprint arXiv:2410.20814},
year = {2024}
}
备注
Accepted to NeurIPS 2024 Datasets and Benchmarks Track