社会科学中基于机器学习的短文本分类:以Twitter上气候变化话题为例
计算与语言
2023-10-10 v1 机器学习
统计方法学
摘要
为分析海量文本,社会科学研究者日益面临文本分类的挑战。当人工标注不可行、研究者须寻求自动化文本分类途径时,计算机科学提供了一套有用的机器学习方法工具箱,但其性能在社会科学中仍缺乏充分研究。本文中,我们将最广泛使用的文本分类器应用于社会科学研究的典型场景——作为大型无标注数据集一部分的、类别出现频次较低的相对小规模标注数据集,以比较其性能。作为示例案例,我们考察关于气候变化的Twitter传播,这是跨学科社会科学研究中受关注渐增的议题。利用一个包含来自各类国际组织、涉及高度模糊的气候变化概念的5,750条推文的新数据集,我们评估了这些方法在依据推文是否关于气候变化进行自动分类时的性能。在此背景下,我们强调两项主要发现。第一,有监督机器学习方法优于最先进的词典法,尤其在类平衡程度提高时。第二,传统机器学习方法(如逻辑回归与随机森林)与复杂的深度学习方法性能相近,而所需训练时间与计算资源远少。结果对社会科学研究中的短文本分析具有重要启示。
引用
@article{arxiv.2310.04452,
title = {Short text classification with machine learning in the social sciences: The case of climate change on Twitter},
author = {Karina Shyrokykh and Maksym Girnyk and Lisa Dellmuth},
journal= {arXiv preprint arXiv:2310.04452},
year = {2023}
}