中文

Duluth 在 SemEval-2020 Task 12:基于逻辑回归的英文冒犯性推文识别

计算与语言 2020-07-28 v1

摘要

本文描述了参加 SemEval-2020 Task 12(社交媒体多语言冒犯性语言识别,OffensEval-2020)的 Duluth 系统。我们参加了三个英语语言任务。我们的系统提供了使用逻辑回归的简单机器学习基线。我们在任务组织者提供的远程监督训练数据上训练了模型,且未使用任何其他资源。正如预期的那样,我们在比较评估中排名不高:任务 A 中 85 支队伍排第 79,任务 B 中 43 支队伍排第 34,任务 C 中 39 支队伍排第 24。我们对结果进行了定性分析,发现黄金标准数据中的类别标签存在一定噪声。我们假设,排名靠前系统的极高准确率(> 90%)可能反映了其方法对训练数据学习得非常好,但可能无法泛化到识别英语冒犯性语言的任务。该分析包括一些推文示例,尽管经过了轻微的删改,但仍然具有冒犯性。

关键词

引用

@article{arxiv.2007.12946,
  title  = {Duluth at SemEval-2020 Task 12: Offensive Tweet Identification in English with Logistic Regression},
  author = {Ted Pedersen},
  journal= {arXiv preprint arXiv:2007.12946},
  year   = {2020}
}

备注

10 pages, To appear in the Proceedings of the 14th International Workshop on Semantic Evaluation (SemEval--2020), December 12-13, 2020, Barcelona (a COLING-2020 workshop, aka OffensEval--2020)