EdinburghNLP在WNUT-2020任务2中的工作:利用带泛化增强的Transformer识别COVID-19推文信息性
计算与语言
2021-04-20 v3 信息检索
机器学习
社会与信息网络
机器学习
摘要
Twitter以及广义上的社交媒体在紧急时期已成为不可或缺的沟通渠道。智能手机设备的普及使人们能够实时报告所观察到的紧急情况。因此,越来越多机构(灾难救援组织与新闻机构)有兴趣以编程方式监测Twitter。故而,识别推文的信息性有助于从海量推文中过滤噪声。本文介绍我们为WNUT-2020任务2(识别信息性COVID-19英文推文)提交的方案。我们最成功的模型是在半监督学习(SSL)设定下训练的Transformer集成,包括RoBERTa、XLNet与BERTweet。所提系统在测试集上取得0.9011的F1分数(排行榜第7名),相较使用FastText嵌入的基线系统表现出显著性能提升。
引用
@article{arxiv.2009.06375,
title = {EdinburghNLP at WNUT-2020 Task 2: Leveraging Transformers with Generalized Augmentation for Identifying Informativeness in COVID-19 Tweets},
author = {Nickil Maveli},
journal= {arXiv preprint arXiv:2009.06375},
year = {2021}
}
备注
Accepted at W-NUT workshop of EMNLP 2020 (7 pages, 6 figures, 3 tables)