哈维穆德学院在SemEval-2019任务4上的极党派新闻检测器
计算与语言
2019-12-10 v1 机器学习
摘要
我们研究了新近提出的Bidirectional Encoder Representations from Transformers(BERT)模型在极党派新闻检测任务上的表现。使用SemEval中手工标注文章的一个子集作为验证集,我们测试了不同BERT模型参数的性能。我们发现,使用不同文章比例的两种不同BERT模型的准确率均持续较高,在验证集上表现最佳的模型达到85%准确率,在测试集上表现最佳的模型达到77%。我们进一步确定,我们的模型表现出强一致性,对同篇文章的独立切片标注相同。最后,我们发现随机打乱word piece顺序会大幅降低验证准确率(至约60%),但打乱四个或以上word piece的组仍维持约80%的准确率,表明该模型主要从局部上下文获益。
引用
@article{arxiv.1905.01962,
title = {Harvey Mudd College at SemEval-2019 Task 4: The Clint Buchanan Hyperpartisan News Detector},
author = {Mehdi Drissi and Pedro Sandoval and Vivaswat Ojha and Julie Medero},
journal= {arXiv preprint arXiv:1905.01962},
year = {2019}
}
备注
Submitted to The 13th International Workshop on Semantic Evaluation (SemEval 2019). 5 pages including references