UTMN 在 SemEval-2020 任务 11 上的系统:一种用于自动宣传检测的简易方案
计算与语言
2020-08-25 v1 机器学习
摘要
本文描述了一种在 SemEval-2020 任务 11 上基于特征调整的快速宣传检测方案。我们使用逐 token 的特征向量化与一个简单的逻辑回归分类器,以快速检验关于数据的不同假设。我们提出了在我们看来最优的方案,但无法将其与任务组织者所建议的评测指标结果相对齐。我们通过改变训练集中两类(Propaganda 与 None)的样本数量、token 向量化所用上下文窗口的大小以及向量化方式的组合,来测试我们的系统如何处理类与特征不平衡。我们的系统在 SemEval2020 任务 11 上的结果为 F-score=0.37。
引用
@article{arxiv.2008.09869,
title = {UTMN at SemEval-2020 Task 11: A Kitchen Solution to Automatic Propaganda Detection},
author = {Elena Mikhalkova and Nadezhda Ganzherli and Anna Glazkova and Yuliya Bidulya},
journal= {arXiv preprint arXiv:2008.09869},
year = {2020}
}
备注
5 pages -- the article proper; 2 pages -- references; 3 figures