利用自然语言处理稳健量化前现代英国文学中的性别差异
计算机与社会
2022-04-13 v1
摘要
研究持续揭示了社会、文化和经济领域中性别差异的程度与意义。近来,自然语言处理(NLP)文献中的计算工具被提出,用于借助相对广泛的数据集和实证严谨的方法度量此类差异。在本文中,我们通过研究前现代时期(本工作定义为十九世纪中叶至二十世纪中叶)出版的版权过期文学文本中的性别差异,在这一研究脉络中做出贡献。使用此类工具的挑战之一是确保质量控制,进而实现可信的统计分析和扩展。另一挑战在于使用已公开且确立有一段时间的材料与方法,既为确保其未来可被使用和审查,也为方法论本身增添信心。我们提出了应对这些挑战的方案,并利用多种度量,展示了前现代文学中女性角色与男性角色出现频率的显著差距。证据表明,当作者为女性时,该差距缩小。在我们绘制的这个长达百年的按十年区间数据中,该差距似乎相对稳定。最后,我们旨在仔细描述与本研究和类似研究相关的局限性与伦理注意事项。
引用
@article{arxiv.2204.05872,
title = {Robust Quantification of Gender Disparity in Pre-Modern English Literature using Natural Language Processing},
author = {Akarsh Nagaraj and Mayank Kejriwal},
journal= {arXiv preprint arXiv:2204.05872},
year = {2022}
}