LLLMs:关于大型语言模型局限性演进研究的数据驱动综述
计算与语言
2026-03-13 v4 人工智能
机器学习
摘要
大型语言模型(LLM)研究迅速增长,同时人们对其局限性的担忧也日益增加。在本综述中,我们采用自下而上的方法,对 2022 年至 2025 年初关于 LLM 局限性的研究(LLLMs)进行了数据驱动的半自动化回顾。从包含 250,000 篇 ACL 和 arXiv 论文的语料库中,我们通过关键词过滤、基于 LLM 的分类(与专家标签进行验证)以及主题聚类(通过两种方法:HDBSCAN+BERTopic 和 LlooM),识别出 14,648 篇相关论文。我们发现,在 2022 年至 2025 年间,ACL 中 LLM 相关论文的份额增加了五倍多,arXiv 中增加了近八倍。自 2022 年以来,LLLMs 研究增长更快,到 2025 年占 LLM 论文的 30% 以上。推理仍然是被研究最多的局限性,其次是泛化、幻觉、偏见和安全。ACL 数据集中主题的分布随时间保持相对稳定,而 arXiv 则向安全风险、对齐、幻觉、知识编辑和多模态方向转移。我们提供了 LLLMs 研究趋势的定量视角,并发布了带有标注摘要的数据集和经过验证的方法论,获取地址:https://github.com/a-kostikova/LLLMs-Survey。
引用
@article{arxiv.2505.19240,
title = {LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Models},
author = {Aida Kostikova and Zhipin Wang and Deidamea Bajri and Ole Pütz and Benjamin Paaßen and Steffen Eger},
journal= {arXiv preprint arXiv:2505.19240},
year = {2026}
}
备注
ACM Computing Surveys (CSUR); 56 pages