中文

Dartmouth CS 在 WNUT-2020 任务 2:使用 BERT 进行信息性 COVID-19 推文分类

计算与语言 2020-12-09 v1 机器学习

摘要

我们描述了为 WNUT-2020 共享任务 2(识别信息性 COVID-19 英文推文)开发的系统。BERT 是用于自然语言处理任务的高性能模型。我们通过微调 BERT 并将其嵌入与推文特定特征拼接并训练支持向量机(SVM)进行分类(以下称 BERT+),提升了 BERT 在此分类任务中的性能。我们将其性能与一组机器学习模型进行比较。我们对非 BERT 模型使用推文特定的数据清洗流水线和词级 TF-IDF 来提取特征。BERT+ 是以 0.8713 的 F1 分数表现最佳的模型。

关键词

引用

@article{arxiv.2012.04539,
  title  = {Dartmouth CS at WNUT-2020 Task 2: Informative COVID-19 Tweet Classification Using BERT},
  author = {Dylan Whang and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2012.04539},
  year   = {2020}
}

备注

Proceedings of the 6th Workshop on Noisy User-generated Text (W-NUT) at EMNLP 2020