刻板性别动作可从网络文本中提取
计算与语言
2025-06-04 v1
摘要
我们从文本语料库和 Twitter 中提取了特定性别的动作,并将其与人们对刻板印象的预期进行了比较。我们使用 Open Mind Common Sense(OMCS)这一常识知识库,来聚焦于与人类常识和日常生活相关的动作。我们利用 Twitter 用户的性别信息以及基于网络语料库的代词/姓名性别启发式方法,来计算这些动作的性别偏见。在较高召回率下,我们获得了基于语料库的预测与人类黄金标准之间 0.47 的斯皮尔曼相关系数,以及在预测黄金标准极性时 0.76 的 ROC 曲线下面积。我们得出结论,利用自然文本(特别是 Twitter 衍生语料库)来用动作的刻板性别预期增强常识知识库是可行的。我们还提供了一个包含 441 个常识动作的数据集,附带人类评判者关于该动作通常是/略微具有男性化/女性化(或中性)的评分,以及另一个包含 21,442 个动作的更大数据集,这些动作由我们在本研究中探讨的方法自动评分。
引用
@article{arxiv.2506.02740,
title = {Stereotypical gender actions can be extracted from Web text},
author = {Amaç Herdağdelen and Marco Baroni},
journal= {arXiv preprint arXiv:2506.02740},
year = {2025}
}