面向句子表征的去偏方法研究
计算与语言
2020-07-17 v1 机器学习
摘要
随着自然语言处理方法日益部署于医疗、法律系统和社会科学等现实场景,有必要认识到它们在塑造社会偏见与刻板印象方面可能发挥的作用。先前工作已揭示广泛使用的词嵌入中存在涉及性别、种族、宗教及其他社会建构的社会偏见。尽管已有一些方法被提出用于去除这些词级嵌入中的偏见,但由于近期向 ELMo 和 BERT 等新型上下文句子表征的转向,需要在句子层面进行去偏。本文中,我们考察句子级表征中社会偏见的存在性,并提出一种新方法 Sent-Debias 以减轻这些偏见。我们表明 Sent-Debias 能有效去除偏见,同时保留在情感分析、语言可接受性和自然语言理解等句子级下游任务上的性能。我们希望我们的工作能启发未来关于刻画并去除广泛采用的句子表征中社会偏见以构建更公平 NLP 的研究。
引用
@article{arxiv.2007.08100,
title = {Towards Debiasing Sentence Representations},
author = {Paul Pu Liang and Irene Mengze Li and Emily Zheng and Yao Chong Lim and Ruslan Salakhutdinov and Louis-Philippe Morency},
journal= {arXiv preprint arXiv:2007.08100},
year = {2020}
}
备注
ACL 2020, code available at https://github.com/pliang279/sent_debias