中文

何时需要人口统计信息?基于数据与建模情景的视角感知仇恨言论检测

计算与语言 2026-05-27 v1

摘要

人口统计信息常用于建模主观任务(如仇恨言论检测)中的标注者视角,但其效用不稳定:在某些情景下可提升性能,在另一些情景下则表现为噪声。本文探讨人口统计特征何时有用。我们将人口统计收益作为数据划分属性与建模框架的函数进行分析。对于数据划分,我们衡量标注者 disagreement(即同一例题由不同标注者赋予不同标签的频率),以及训练规模与训练-测试人口统计覆盖度。我们发现,人口统计收益集中于训练 disagreement 较低、测试 disagreement 较高、对模糊性测量粒度较细、训练数据充足且人口统计覆盖范围更大的情景。针对这些情景,我们引入一种门控式人口统计残差模型,将人口统计视为对文本唯一预测的选择性调整。MHS和POPQUORN上的实验表明,该设计在高 disagreement 或低置信度例题上尤为有效。总体而言,本文结果表明,人口统计信息不应默认为有用;其价值取决于数据情景与建模框架的共同作用。

关键词

引用

@article{arxiv.2605.27313,
  title  = {When Does Demographic Information Help? Data and Modeling Regimes for Perspective-Aware Hate Speech Detection},
  author = {Weibin Cai and Reza Zafarani},
  journal= {arXiv preprint arXiv:2605.27313},
  year   = {2026}
}