机器学习在说我的语言吗?对跨越8种人类语言的NLP流程的批判性审视
计算与语言
2020-07-14 v1 机器学习
摘要
自然语言处理(NLP)正日益用作关键决策系统(如用于筛选求职者名单的简历解析器)的核心组件。NLP系统常摄取大量人类文本语料,试图从过去人类行为与决策中学习,以产生对我们未来世界提出建议的系统。当今有超过7000种人类语言在使用,而典型NLP流程低估了其中大多数语言使用者的声音,同时放大了其他语言使用者的声音。本文中一个包含8种语言——英语、中文、乌尔都语、波斯语、阿拉伯语、法语、西班牙语和沃洛夫语——使用者的团队,批判性审视了典型NLP流程,以及即便某语言在技术上受支持,仍存在大量实质性保留条件阻碍充分参与。尽管许多工具与资源在多语言支持上有巨大且令人钦佩的投入,我们仍在做出系统性且剧烈低估世界上多数人群声音的NLP引导决策。
引用
@article{arxiv.2007.05872,
title = {Is Machine Learning Speaking my Language? A Critical Look at the NLP-Pipeline Across 8 Human Languages},
author = {Esma Wali and Yan Chen and Christopher Mahoney and Thomas Middleton and Marzieh Babaeianjelodar and Mariama Njie and Jeanna Neefe Matthews},
journal= {arXiv preprint arXiv:2007.05872},
year = {2020}
}
备注
Participatory Approaches to Machine Learning Workshop, 37th International Conference on Machine Learning