中文

自然语言处理偏差研究中的“性取向”理论

计算机与社会 2025-11-19 v2 计算与语言

摘要

近年来,自然语言处理 (NLP) 领域取得了显著进展,使商业化语言模型成为广泛且高效用的工具。与此同时,针对 NLP 任务如何反映、延续和放大性别偏见和种族偏见等社会偏见的跨学科研究呈爆发式增长。该领域的一个重要空白是对 queer 性取向如何被编码以及在 NLP 系统和实践者之间被误表示进行详细分析。跟随 AI 公平性领域的前期工作,我们记录了 sexuality 是如何在55篇量化性取向 NLP 偏差的文章中被定义和操作化的。我们发现该文献调查中大多数地方性取向并未得到清晰定义,表明依赖于假设或规范性的性/情感实践和身份认同。进一步地,我们发现从 NLP 技术中提取偏差输出的方法常常混淆了性别与性取向身份,导致对 queerness 的单一化表述,从而不当地量化了偏差。为了改进基于性取向的 NLP 偏差分析,我们结合理论分析和数值拟合的结果,提出了鼓励更深入地与 queer 社区及跨学科文献进行互动的建议。

关键词

引用

@article{arxiv.2506.22481,
  title  = {Theories of "Sexuality" in Natural Language Processing Bias Research},
  author = {Jacob Hobbs},
  journal= {arXiv preprint arXiv:2506.22481},
  year   = {2025}
}

备注

17 pages, 6 tables, 1 figure, undergraduate senior thesis, submitted to The Spectra: The Virginia Engineering and Science Research Journal