中文

理解BLOOM:一项关于多样化NLP任务的实证研究

计算与语言 2023-03-16 v2

摘要

我们通过近期发布的BLOOM模型的视角审视大语言模型(LLM)的格局,以理解BLOOM及其他仅解码器LLM相较于BERT风格仅编码器模型的性能。我们通过在小规模BLOOM模型变体(\textit{350m/560m}与\textit{1b3/1b7})上评估若干NLP基准数据集与流行排行榜来实现此目的。我们作出如下观察:(1) 与其他如GPT和BERT等LLM不同,BLOOM性能不随参数规模扩展。微调BLOOM模型的实验显示560m变体表现与1b7变体相似或更佳;(2) 零样本跨语言与多语言微调实验表明,BLOOM与单语GPT-2模型相当或更差;(3) 使用RealToxicityPrompts数据集对基于提示的文本生成进行毒性分析显示,BLOOM生成的文本毒性至少比GPT-2与GPT-3模型低17%。

关键词

引用

@article{arxiv.2211.14865,
  title  = {Understanding BLOOM: An empirical study on diverse NLP tasks},
  author = {Parag Pravin Dakle and SaiKrishna Rallabandi and Preethi Raghavan},
  journal= {arXiv preprint arXiv:2211.14865},
  year   = {2023}
}