大规模语言模型能带来什么改变?HyperCLOVA 深度研究:数十亿规模的韩语生成式预训练 Transformer
计算与语言
2021-11-30 v2
摘要
GPT-3 展示了在数千亿规模数据上训练的大规模语言模型(LMs)的卓越上下文学习能力。在此,我们探讨了 GPT-3 论文较少报道的一些遗留问题,例如非英语 LM、不同规模模型的性能,以及近期引入的提示优化对上下文学习的影响。为了实现这一目标,我们介绍了 HyperCLOVA,这是 82B GPT-3 的韩语变体,在 560B token 的以韩语为中心的语料库上训练。得益于我们针对韩语特定的分词,HyperCLOVA 结合我们的训练配置在各种韩语下游任务中展现出了最先进的上下文零样本和少样本学习性能。此外,我们展示了基于提示的学习的性能优势,并演示了如何将其集成到提示工程流程中。然后,我们通过介绍 HyperCLOVA studio(一个交互式提示工程界面),探讨了为 ML 非专家提供 AI 原型设计能力从而实现 No Code AI 范式的可能性。最后,我们通过三个成功的内部应用展示了我们方法的潜力。
引用
@article{arxiv.2109.04650,
title = {What Changes Can Large-scale Language Models Bring? Intensive Study on HyperCLOVA: Billions-scale Korean Generative Pretrained Transformers},
author = {Boseop Kim and HyoungSeok Kim and Sang-Woo Lee and Gichang Lee and Donghyun Kwak and Dong Hyeon Jeon and Sunghyun Park and Sungju Kim and Seonhoon Kim and Dongpil Seo and Heungsub Lee and Minyoung Jeong and Sungjae Lee and Minsub Kim and Suk Hyun Ko and Seokhun Kim and Taeyong Park and Jinuk Kim and Soyoung Kang and Na-Hyeon Ryu and Kang Min Yoo and Minsuk Chang and Soobin Suh and Sookyo In and Jinseong Park and Kyungduk Kim and Hiun Kim and Jisu Jeong and Yong Goo Yeo and Donghoon Ham and Dongju Park and Min Young Lee and Jaewook Kang and Inho Kang and Jung-Woo Ha and Woomyoung Park and Nako Sung},
journal= {arXiv preprint arXiv:2109.04650},
year = {2021}
}
备注
Accepted to EMNLP2021 as a long paper. Fixed some typos