中文

TweetBERT:用于推文文本分析的预训练语言表示模型

计算与语言 2020-10-22 v1

摘要

Twitter是众所周知的微博社交网站,用户在其中实时表达其观点和看法。因此,推文往往包含有价值的信息。随着深度学习在自然语言处理领域的进步,从推文中提取有意义的信息已成为自然语言研究者日益增长的兴趣。将现有语言表示模型应用于从Twitter提取信息通常不能产生良好结果。此外,目前尚无针对社交媒体领域文本分析的现有语言表示模型。因此,在本文中,我们介绍了两个TweetBERT模型,它们是特定领域的语言表示模型,在数百万条推文上进行了预训练。我们表明,TweetBERT模型在推文文本挖掘任务上显著优于传统BERT模型,在每个推特数据集上超出7%以上。我们还通过在31个不同数据集上评估七个BERT模型提供了广泛分析。我们的结果验证了我们的假设:在推特语料上持续训练语言模型有助于提升Twitter上的性能。

关键词

引用

@article{arxiv.2010.11091,
  title  = {TweetBERT: A Pretrained Language Representation Model for Twitter Text Analysis},
  author = {Mohiuddin Md Abdul Qudar and Vijay Mago},
  journal= {arXiv preprint arXiv:2010.11091},
  year   = {2020}
}