中文

UTMN 在 SemEval-2020 任务 11 上的系统:一种用于自动宣传检测的简易方案

计算与语言 2020-08-25 v1 机器学习

摘要

本文描述了一种在 SemEval-2020 任务 11 上基于特征调整的快速宣传检测方案。我们使用逐 token 的特征向量化与一个简单的逻辑回归分类器,以快速检验关于数据的不同假设。我们提出了在我们看来最优的方案,但无法将其与任务组织者所建议的评测指标结果相对齐。我们通过改变训练集中两类(Propaganda 与 None)的样本数量、token 向量化所用上下文窗口的大小以及向量化方式的组合,来测试我们的系统如何处理类与特征不平衡。我们的系统在 SemEval2020 任务 11 上的结果为 F-score=0.37。

关键词

引用

@article{arxiv.2008.09869,
  title  = {UTMN at SemEval-2020 Task 11: A Kitchen Solution to Automatic Propaganda Detection},
  author = {Elena Mikhalkova and Nadezhda Ganzherli and Anna Glazkova and Yuliya Bidulya},
  journal= {arXiv preprint arXiv:2008.09869},
  year   = {2020}
}

备注

5 pages -- the article proper; 2 pages -- references; 3 figures