中文

预训练数据的高性价比选择:以社交媒体上 BERT 预训练为例

计算与语言 2020-10-06 v1

摘要

近期关于特定领域 BERT 模型的研究表明,当模型在领域内数据上预训练时,下游任务上的有效性可得到提升。这些模型所用的预训练数据常依据其主题(如生物学或计算机科学)筛选。鉴于使用社交媒体文本的应用范围及其独特的语言变体,我们分别基于推文与论坛文本预训练了两个模型,并从经验上证明了这两种资源的有效性。此外,我们探究了如何利用相似度度量来提名领域内预训练数据。我们在 https://bit.ly/35RpTf0 公开发布了我们的预训练模型。

关键词

引用

@article{arxiv.2010.01150,
  title  = {Cost-effective Selection of Pretraining Data: A Case Study of Pretraining BERT on Social Media},
  author = {Xiang Dai and Sarvnaz Karimi and Ben Hachey and Cecile Paris},
  journal= {arXiv preprint arXiv:2010.01150},
  year   = {2020}
}

备注

Findings of EMNLP 2020