高度不平衡文本数据中有限总体统计量的预测驱动估计:公共仇恨犯罪估计
计算与语言
2025-05-09 v1 机器学习
摘要
当获取目标变量标签需要人工标注时,估计文本文档有限总体中的总体参数可能具有挑战性。为了解决这个问题,我们将来自 Transformer 编码器神经网络的预测与成熟的调查抽样估计器相结合,使用模型预测作为辅助变量。该方法在基于瑞典警方报告的瑞典仇恨犯罪统计中得到了应用。使用 Hansen-Hurwitz 估计量、差值估计和分层随机抽样估计,推导出了仇恨犯罪年度数量和警方漏报率的估计值。我们得出结论,如果有标注的训练数据可用,所提出的方法可以提供非常高效的估计,并减少人工标注所花费的时间。
引用
@article{arxiv.2505.04643,
title = {Prediction-powered estimators for finite population statistics in highly imbalanced textual data: Public hate crime estimation},
author = {Hannes Waldetoft and Jakob Torgander and Måns Magnusson},
journal= {arXiv preprint arXiv:2505.04643},
year = {2025}
}