SWSR:用于在线性别歧视检测的中文数据集与词典
计算与语言
2021-08-09 v1
摘要
随着社交媒体平台中在线性别歧视影响互联网健康发展并对社会产生负面影响,其日益受到关注。尽管性别歧视检测领域的研究不断增长,但大多集中于英语语言与 Twitter 平台。我们的目标是通过考察新浪微博上的中文以拓宽该研究范围。我们提出了首个中文性别歧视数据集——新浪微博性别歧视评论(SWSR)数据集,以及一个由辱骂性与性别相关术语构成的大型中文词典 SexHateLex。我们介绍了数据收集与标注过程,并对数据集特征进行探索性分析以验证其质量并展示性别歧视在中文中的表现形式。SWSR 数据集提供不同粒度级别的标注,包括(i)性别歧视或非性别歧视,(ii)性别歧视类别以及(iii)目标类型,这些标注可用于构建计算方法以识别和研究更细粒度的性别相关辱骂语言。我们利用最先进的机器学习模型对三项性别歧视分类任务进行了实验。我们的结果展示了具有竞争力的性能,为中文性别歧视检测提供了基准,并通过错误分析指出了中文 NLP 中亟需更多研究的开放挑战。SWSR 数据集与 SexHateLex 词典已公开可用。
引用
@article{arxiv.2108.03070,
title = {SWSR: A Chinese Dataset and Lexicon for Online Sexism Detection},
author = {Aiqi Jiang and Xiaohan Yang and Yang Liu and Arkaitz Zubiaga},
journal= {arXiv preprint arXiv:2108.03070},
year = {2021}
}
备注
44 pages, 5 figure, 9 tables