自动化内容分析中的误分类导致回归偏差:能修正吗?能!
机器学习
2024-12-10 v2 人工智能
计算与语言
计算机与社会
摘要
自动化分类器(ACs)常通过监督式机器学习(SML)构建,可对从文本到图像和视频的大规模、统计效力强的数据样本进行分类,并已成为传播学及相关领域中广泛流行的测量工具。尽管流行,即便高度准确的分类器也会出错,从而导致误分类偏差并使下游分析得出误导性结果——除非此类分析对这些误差加以考量。正如我们在对 SML 应用的系统性文献综述中所展示的,传播学者在很大程度上忽视了误分类偏差。原则上,现有统计方法可利用由人类标注者创建的“金标准”验证数据来纠正误分类偏差并给出一致估计。我们引入并检验了此类方法,包括我们在 R 包 misclassificationmodels 中设计并实施的一种新方法,通过蒙特卡洛模拟揭示各方法的局限(我们亦公开了这些模拟)。基于结果,我们推荐新误差修正方法,因其通用且高效。总之,即便低于常见精度标准或存在系统性误分类的自动化分类器,在严谨的研究设计与恰当的误差修正方法下,仍可用于测量。
引用
@article{arxiv.2307.06483,
title = {Misclassification in Automated Content Analysis Causes Bias in Regression. Can We Fix It? Yes We Can!},
author = {Nathan TeBlunthuis and Valerie Hase and Chung-Hong Chan},
journal= {arXiv preprint arXiv:2307.06483},
year = {2024}
}
备注
66 page, 43 Figures. Accepted for publication in Communication Methods & Measures. Top Paper Award from the 2023 Annual Meeting of The International Communication Association Computational Methods Division