中文

关联词嵌入性别偏见与性别差距:跨文化分析

计算与语言 2026-01-27 v1

摘要

现代 NLP 任务的模型通常采用机器学习技术并在新闻稿、社交媒体或其他文化衍生文本上进行训练。最近这些模型因种族和性别偏见受到密切关注,这些偏见源自其训练文本中固有的偏见。虽然这些偏见常常次优,最近的工作提出了方法来纠正它们;但这些偏见可能揭示了生产训练文本的文化中实际的种族或性别差距,从而帮助我们通过大数据理解文化背景。本文提出了一种量化词嵌入中性别偏见的方法,然后将其用于表征教育、政治、经济和健康领域的统计性别差距。我们在2018年的推特数据上对这些指标进行了验证,涵盖51个美国地区和99个国家。我们将州和国家词嵌入偏见与18个国际性别差距以及5个美国性别差距相关,刻画了规律性和预测强度。

关键词

引用

@article{arxiv.2601.17203,
  title  = {Relating Word Embedding Gender Biases to Gender Gaps: A Cross-Cultural Analysis},
  author = {Scott Friedman and Sonja Schmer-Galunder and Anthony Chen and Jeffrey Rye},
  journal= {arXiv preprint arXiv:2601.17203},
  year   = {2026}
}

备注

7 pages, 5 figures. Presented at the First Workshop on Gender Bias in Natural Language Processing (GeBNLP 2019)