理解BLOOM:一项关于多样化NLP任务的实证研究
计算与语言
2023-03-16 v2
摘要
我们通过近期发布的BLOOM模型的视角审视大语言模型(LLM)的格局,以理解BLOOM及其他仅解码器LLM相较于BERT风格仅编码器模型的性能。我们通过在小规模BLOOM模型变体(\textit{350m/560m}与\textit{1b3/1b7})上评估若干NLP基准数据集与流行排行榜来实现此目的。我们作出如下观察:(1) 与其他如GPT和BERT等LLM不同,BLOOM性能不随参数规模扩展。微调BLOOM模型的实验显示560m变体表现与1b7变体相似或更佳;(2) 零样本跨语言与多语言微调实验表明,BLOOM与单语GPT-2模型相当或更差;(3) 使用RealToxicityPrompts数据集对基于提示的文本生成进行毒性分析显示,BLOOM生成的文本毒性至少比GPT-2与GPT-3模型低17%。
引用
@article{arxiv.2211.14865,
title = {Understanding BLOOM: An empirical study on diverse NLP tasks},
author = {Parag Pravin Dakle and SaiKrishna Rallabandi and Preethi Raghavan},
journal= {arXiv preprint arXiv:2211.14865},
year = {2023}
}