中文

面向印地语语言表示的社会感知偏差测量

计算与语言 2022-05-10 v2

摘要

语言表示是跨 NLP 应用使用的高效工具,但它们充斥着编码的社会偏差。这些偏差已被广泛研究,但主要关注英语语言表示和西方社会背景下常见的偏差。在这项工作中,我们研究印地语语言表示中存在的偏差,重点关注与种姓和宗教相关的偏差。我们展示了偏差如何基于语言广泛使用地区的历史和文化而特定于具体的语言表示,以及相同的社会偏差(如二元性别相关偏差)如何在不同语言中由不同的词语和文本片段编码。我们工作的发现凸显了在建模语言表示时文化意识和语言人工制品的必要性,以便更好地理解所编码的偏差。

关键词

引用

@article{arxiv.2110.07871,
  title  = {Socially Aware Bias Measurements for Hindi Language Representations},
  author = {Vijit Malik and Sunipa Dev and Akihiro Nishi and Nanyun Peng and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2110.07871},
  year   = {2022}
}

备注

12 Pages (5 Pages main content+ 2 pages for references + 5 Pages Appendix)