历史文献中交叉偏见的度量
计算与语言
2023-05-23 v1 计算机与社会
机器学习
摘要
对历史文本中偏见的数据驱动分析有助于阐明现代社会盛行偏见的起源与发展。然而,数字化的历史文献对 NLP 从业者构成挑战,因为这些语料库存在光学字符识别(OCR)引入的错误且以古老语言写成。在本文中,我们调查殖民时代(18 至 19 世纪)加勒比地区出版的历史报纸中偏见的连续性与变迁。我们的分析沿性别、种族及其交叉的轴线进行。我们通过开展时序研究来考察这些偏见,其中使用分布语义模型和词嵌入度量词汇关联的演变。此外,我们评估了旨在处理 OCR 生成数据的技术的有效性,并评估其在训练于和应用至含噪历史报纸时的稳定性。我们发现词嵌入的稳定性与其对历史数据集的兼容性之间存在权衡。我们提供证据表明性别与种族偏见相互依赖,且其交叉引发独特效应。这些发现与交叉性理论一致,该理论强调影响具有多重边缘化身份者的偏见叠加后大于各部分之和。
引用
@article{arxiv.2305.12376,
title = {Measuring Intersectional Biases in Historical Documents},
author = {Nadav Borenstein and Karolina Stańczak and Thea Rolskov and Natália da Silva Perez and Natacha Klein Käfer and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2305.12376},
year = {2023}
}
备注
Accepted to Findings of ACL2023