中文

预训练基础模型综述:从BERT到ChatGPT的历史

人工智能 2023-05-02 v3 计算与语言 机器学习

摘要

预训练基础模型(PFM)被视为具有不同数据模态的各种下游任务的基础。一个PFM(例如BERT、ChatGPT和GPT-4)在大规模数据上进行训练,为广泛的下游应用提供了合理的参数初始化。BERT从Transformer中学习双向编码器表示,这些Transformer在大规模数据集上作为上下文语言模型进行训练。类似地,生成式预训练Transformer(GPT)方法采用Transformer作为特征提取器,并在大规模数据集上使用自回归范式进行训练。最近,ChatGPT在大型语言模型上显示出令人瞩目的成功,它应用了具有零样本或少样本提示的自回归语言模型。PFM的显著成就为人工智能的各个领域带来了重大突破。大量研究提出了不同的方法,这增加了对更新综述的需求。本研究对文本、图像、图以及其他数据模态的PFM的最新研究进展、挑战和机遇进行了全面回顾。该综述涵盖了自然语言处理、计算机视觉和图学习中使用的PFM的基本组件和现有预训练方法。此外,它还探讨了用于不同数据模态的高级PFM以及考虑数据质量和数量的统一PFM。该综述还讨论了与PFM基础相关的研究,例如模型效率和压缩、安全性和隐私性。最后,该研究提供了PFM领域的关键启示、未来研究方向、挑战和开放问题。总体而言,本综述旨在阐明PFM在可扩展性、安全性、逻辑推理能力、跨领域学习能力以及面向通用人工智能的用户友好交互能力方面的研究。

关键词

引用

@article{arxiv.2302.09419,
  title  = {A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT},
  author = {Ce Zhou and Qian Li and Chen Li and Jun Yu and Yixin Liu and Guangjing Wang and Kai Zhang and Cheng Ji and Qiben Yan and Lifang He and Hao Peng and Jianxin Li and Jia Wu and Ziwei Liu and Pengtao Xie and Caiming Xiong and Jian Pei and Philip S. Yu and Lichao Sun},
  journal= {arXiv preprint arXiv:2302.09419},
  year   = {2023}
}

备注

99 pages, 16 figures