在线百科全书的审查:对NLP模型的影响
计算与语言
2021-01-26 v1 人工智能
计算机与社会
机器学习
摘要
虽然人工智能为世界各地人们使用的许多工具提供了支撑,但最近的研究引起人们关注:驱动AI的算法并非没有政治、刻板印象和偏见。虽然该领域的大多数工作集中在AI如何加剧现有不平等和歧视上,但很少有研究关注政府如何积极塑造训练数据。我们描述了审查如何影响维基百科语料库的发展,这些文本数据经常被用作NLP算法的预训练输入。我们表明,在百度百科(一个中文在线百科全书)上训练的词嵌入,在形容词与一系列关于民主、自由、集体行动、平等以及中国人物和历史事件的概念之间的关联,与经常被屏蔽但未经审查的中文维基百科相比,存在很大差异。我们通过研究这些差异在下游AI应用中的使用来检验其影响。我们的论文展示了政府压制、审查和自我审查如何影响训练数据以及从中衍生的应用。
引用
@article{arxiv.2101.09294,
title = {Censorship of Online Encyclopedias: Implications for NLP Models},
author = {Eddie Yang and Margaret E. Roberts},
journal= {arXiv preprint arXiv:2101.09294},
year = {2021}
}
备注
Accepted for publication at ACM FAccT 2021