NEO-BENCH:利用新词评估大语言模型的鲁棒性
计算与语言
2024-08-14 v4
摘要
大语言模型(LLMs)的性能会因模型训练所用数据与推理期间所见较新文本之间的时间漂移而下降。导致数据漂移的语言变化中一个未被充分研究的途径是新词(neologisms,即新词形)随时间的出现。我们利用几种流行的收集方法创建了一个多样化的近期英语新词资源。我们通过比较包含新词的句子与将新词替换为现有替代词的近乎相同的句子,利用新词分析时间漂移。当句子中引入单个新词时,机器翻译的模型性能几乎减半。受这些结果启发,我们构建了一个基准,通过各种自然语言理解任务和模型困惑度来评估 LLMs 对新词的泛化能力。具有较晚知识截止日期的模型表现出较低的困惑度,并在下游任务中表现更好。LLMs 受影响的程度还取决于词汇的语言起源,这表明新词对于静态 LLMs 而言处理起来十分复杂。我们将发布我们的基准和用于复现实验的代码。
引用
@article{arxiv.2402.12261,
title = {NEO-BENCH: Evaluating Robustness of Large Language Models with Neologisms},
author = {Jonathan Zheng and Alan Ritter and Wei Xu},
journal= {arXiv preprint arXiv:2402.12261},
year = {2024}
}
备注
accepted to ACL 2024 main conference, 9 pages