中文

面向基于 Transformer 大型语言模型的动态通用逼近理论

人工智能 2024-12-12 v5 计算与语言 机器学习

摘要

语言模型已成为人工智能中的关键关注领域,尤其是以 ChatGPT 等突破性创新为标志。大规模 Transformer 网络迅速成为推进自然语言处理算法的领先方法。基于 Transformer 架构构建,这些模型实现了类似人类交流的交互,凭借广泛的知识,甚至可以帮助指导人类任务。尽管它们拥有令人印象深刻的能力和日益增长的复杂性,但仍有一个关键问题——大型语言模型(LLMs)的理论基础。Transformer 为什么能够为智能语言应用(如翻译和编码)提供动力?LLMs 的内在学习能力的底层机制是什么?LoRA 方案如何增强 LLMs 的微调?剪枝 LLMs 的实用性基于什么?为了回答这些关键问题并探索 LLMs 内的技术策略,我们利用通用逼近理论(UAT)提供了一个理论背景,为这些进步所支持的机制投以灯光。

关键词

引用

@article{arxiv.2407.00958,
  title  = {Dynamic Universal Approximation Theory: The Basic Theory for Transformer-based Large Language Models},
  author = {Wei Wang and Qing Li},
  journal= {arXiv preprint arXiv:2407.00958},
  year   = {2024}
}