ALCUNA:大语言模型遭遇新知识
计算与语言
2023-10-24 v1
摘要
随着自然语言处理(NLP)的快速发展,大规模语言模型(LLMs)如今在多个领域的各类任务中表现出色。然而,现有基准可能无法充分衡量这些模型的能力,尤其是在面对新知识时。本文针对缺乏评估 LLMs 处理新知识能力的基准这一问题,新知识是快速演进世界中重要且具有挑战性的方面。我们提出一种称为 KnowGen 的方法,通过更改现有实体的属性与关系来生成新知识,从而产生与现实世界实体不同的人工实体。借助 KnowGen,我们引入名为 ALCUNA 的基准,以评估 LLMs 在知识理解、区分与关联方面的能力。我们对若干 LLMs 进行基准测试,揭示其在面对新知识时表现不尽如人意,尤其在新知识与内部知识之间的推理方面。我们还探讨了实体相似度对模型实体知识理解的影响以及上下文实体的影响。我们呼吁在新场景或新知识的条件下使用 LLMs 时需保持谨慎,并希望我们的基准有助于推动 LLMs 在面对新知识时的发展。
引用
@article{arxiv.2310.14820,
title = {ALCUNA: Large Language Models Meet New Knowledge},
author = {Xunjian Yin and Baizhou Huang and Xiaojun Wan},
journal= {arXiv preprint arXiv:2310.14820},
year = {2023}
}
备注
EMNLP 2023