中文

BERTweet:一种面向英文推文的预训练语言模型

计算与语言 2020-10-06 v2 机器学习

摘要

我们提出 BERTweet,这是首个公开的面向英文推文的大规模预训练语言模型。我们的 BERTweet 具有与 BERT-base(Devlin 等,2019)相同的架构,并使用 RoBERTa 预训练流程(Liu 等,2019)进行训练。实验表明,BERTweet 优于强基线 RoBERTa-base 和 XLM-R-base(Conneau 等,2020),在三项推文 NLP 任务上取得了比先前最先进(SOTA)模型更优的性能:词性标注、命名实体识别和文本分类。我们以 MIT 许可证发布 BERTweet,以促进未来基于推文数据的研究与应用。我们的 BERTweet 可在 https://github.com/VinAIResearch/BERTweet 获取。

关键词

引用

@article{arxiv.2005.10200,
  title  = {BERTweet: A pre-trained language model for English Tweets},
  author = {Dat Quoc Nguyen and Thanh Vu and Anh Tuan Nguyen},
  journal= {arXiv preprint arXiv:2005.10200},
  year   = {2020}
}

备注

In Proceedings of EMNLP 2020: System Demonstrations