中文

政治研究中的小数据问题:一项批判性复现研究

计算与语言 2021-09-28 v1

摘要

在2019年一篇常被引用的关于机器学习在政治研究中应用的论文中,Anastasopoulos 和 Whitford (A&W) 提出了一种针对组织声誉相关推文的文本分类方法。他们论文的目的是为公共行政学者和从业者提供一份关于机器学习使用的“实践指南”。在本文中,我们通过复现 A&W 的实验,并就模型稳定性及预处理效果(两者均与小数据量有关)进行额外分析,来跟进这项工作。我们表明:(1) 小数据导致分类模型对随机训练-测试集划分的变异高度敏感;(2) 所应用的预处理导致数据极其稀疏,数据中大多数项目最多只有两个非零词汇特征。通过改变预处理流程步骤的额外实验,我们表明,无论预处理选择如何,小数据量都会持续引发问题。基于我们的发现,我们认为 A&W 关于组织声誉推文自动分类的结论——无论是实质性的还是方法论的——均无法维持,需要更大的数据集进行训练和更仔细的验证。

关键词

引用

@article{arxiv.2109.12911,
  title  = {Small data problems in political research: a critical replication study},
  author = {Hugo de Vos and Suzan Verberne},
  journal= {arXiv preprint arXiv:2109.12911},
  year   = {2021}
}

备注

9 pages, 1 figure, 1st Workshop on Computational Linguistics for Political Text Analysis (CPSS-2021) D\"usseldorf, Germany Part of proceedings. Full proceedings: https://gscl.org/media/pages/arbeitskreise/cpss/cpss-2021/workshop-proceedings/352683648-1631172151/cpss2021-proceedings.pdf