脱身机器学习:论 NLP 中客观性的幻象
人工智能
2021-01-29 v1 计算与语言
计算机与社会
摘要
机器学习旨在从所提供的数据集中识别并编码知识体系。然而,数据编码了主观内容,这决定了在其上训练的模型的可能结果。由于此类主观性导致社会部分群体的边缘化,它被称为(社会)‘偏见’并力图被消除。在本文中,我们将机器学习界中关于偏见的论述置于开发过程中的主观选择背景下进行语境化。通过考量数据与模型开发中的选择如何建构主观性、或模型中表征的偏见,我们认为解决并缓解偏见近乎不可能。这是因为数据与机器学习模型皆为意义在开发流水线各步骤中被建构的对象,从数据选择、标注到模型训练与分析。相应地,我们发现盛行的偏见论述在应对社会边缘化方面存在局限。我们建议对此保持审慎,并接受去偏方法仅能纠正一小部分偏见。
引用
@article{arxiv.2101.11974,
title = {Disembodied Machine Learning: On the Illusion of Objectivity in NLP},
author = {Zeerak Waseem and Smarika Lulz and Joachim Bingel and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2101.11974},
year = {2021}
}
备注
In review