中文

What the [MASK]?理解特定语言 BERT 模型

计算与语言 2020-03-09 v1

摘要

近来,由于新颖的预训练上下文表示模型的出现,自然语言处理(NLP)在许多领域取得了令人瞩目的进展。特别地,Devlin 等人(2019)提出了一种称为 BERT(Bidirectional Encoder Representations from Transformers,基于 Transformer 的双向编码器表示)的模型,使研究者能够通过在自己的数据集与任务上微调表示,而无需开发与训练高度特定的架构,便可在众多 NLP 任务上获得最先进的性能。作者还发布了多语言 BERT(mBERT),一个在 104 种语言语料上训练的模型,可作为通用语言模型。该模型在零样本跨语言自然语言推理任务上取得了令人印象深刻的成果。受 BERT 模型潜力的驱动,NLP 社区已开始研究并生成大量在特定语言上训练、在特定数据域与任务上测试的 BERT 模型。这使我们能通过将其与这些更特定模型的性能比较,评估 mBERT 作为通用语言模型的真实潜力。本文呈现了特定语言 BERT 模型的当前最新进展,从不同维度(即架构、数据域与任务)给出整体图景。我们的目标是提供关于特定语言(language-specific)BERT 模型与 mBERT 之间共性与差异的直接而清晰的概览。我们还提供了一个交互式且持续更新的网站,可用于探索我们所收集的信息,网址为 https://bertlang.unibocconi.it。

关键词

引用

@article{arxiv.2003.02912,
  title  = {What the [MASK]? Making Sense of Language-Specific BERT Models},
  author = {Debora Nozza and Federico Bianchi and Dirk Hovy},
  journal= {arXiv preprint arXiv:2003.02912},
  year   = {2020}
}