中文

从文盲群体构建代表性语料库:针对发展中国家的挑战与缓解策略综述

计算与语言 2021-02-08 v1

摘要

当前 NLP 中采用的大多数成熟数据收集方法都依赖于说话者具备读写能力的假设。因此,所收集的语料库在很大程度上未能代表全球人口中的广大群体,这些群体往往是社会上最脆弱和边缘化的人群,并且通常生活在农村发展中地区。这类代表性不足的群体不仅在建模和系统设计的决策中被忽视,而且被阻挡在通过数据驱动 NLP 所取得的开发成果之外。本文旨在解决 NLP 语料库中对于文盲群体的代表性不足问题:我们识别了在低收入国家高文盲率农村社区收集数据时可能出现的潜在偏差与伦理问题,并提出了一套实用的缓解策略以帮助未来的工作。

关键词

引用

@article{arxiv.2102.02841,
  title  = {Building Representative Corpora from Illiterate Communities: A Review of Challenges and Mitigation Strategies for Developing Countries},
  author = {Stephanie Hirmer and Alycia Leonard and Josephine Tumwesige and Costanza Conforti},
  journal= {arXiv preprint arXiv:2102.02841},
  year   = {2021}
}

备注

Accepted at EACL 2021