OPT:开放预训练 Transformer 语言模型
计算与语言
2022-06-22 v4 机器学习
摘要
大语言模型(LLM)通常需训练数十万计算日,已展现出卓越的零样本与少样本学习能力。鉴于其计算成本,若无大量资金投入,这些模型难以复现。对于少数通过 API 提供的模型,不授予对完整模型权重的访问权限,使其难以被研究。我们提出 Open Pre-trained Transformers(OPT),一套仅含解码器的预训练 Transformer,参数规模从 125M 到 175B,旨在与感兴趣的研究者全面且负责任地共享。我们表明 OPT-175B 可与 GPT-3 相媲美,而开发所需碳足迹仅为后者的 1/7。我们还发布了记录所面临基础设施挑战的日志簿,以及用于实验所有已发布模型的代码。
引用
@article{arxiv.2205.01068,
title = {OPT: Open Pre-trained Transformer Language Models},
author = {Susan Zhang and Stephen Roller and Naman Goyal and Mikel Artetxe and Moya Chen and Shuohui Chen and Christopher Dewan and Mona Diab and Xian Li and Xi Victoria Lin and Todor Mihaylov and Myle Ott and Sam Shleifer and Kurt Shuster and Daniel Simig and Punit Singh Koura and Anjali Sridhar and Tianlu Wang and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2205.01068},
year = {2022}
}