大语言模型的历史、发展与原理:入门综述
计算与语言
2024-09-24 v3
摘要
语言模型是自然语言处理 (NLP) 的基石,利用数学方法概括语言规律和知识以进行预测和生成。经过数十年的广泛研究,语言建模已从最初的统计语言模型 (SLMs) 发展到大语言模型 (LLMs) 的当代格局。值得注意的是,LLMs 的迅速演进已使其具备处理、理解和生成人类水平文本的能力。然而,尽管 LLMs 在改善工作和个人生活方面提供了显著优势,但普通从业者对这些模型的背景和原理了解有限,阻碍了其潜力的充分发挥。值得注意的是,大多数 LLM 综述侧重于特定方面并使用专业语言,这对缺乏相关背景知识的从业者构成了挑战。鉴于此,本综述旨在提供 LLMs 的易懂概述,以协助更广泛的受众。它致力于通过探索语言模型的历史背景并追溯其随时间的演进来促进全面理解。该综述进一步调查了影响 LLMs 发展的因素,强调了关键贡献。此外,它专注于阐明 LLMs 的基本原理,为受众配备必要的理论知识。该综述还突出了现有工作的局限性,并指出了有前景的未来方向。
引用
@article{arxiv.2402.06853,
title = {History, Development, and Principles of Large Language Models-An Introductory Survey},
author = {Zichong Wang and Zhibo Chu and Thang Viet Doan and Shiwen Ni and Min Yang and Wenbin Zhang},
journal= {arXiv preprint arXiv:2402.06853},
year = {2024}
}