通过因果推断的词嵌入:降低性别偏见与保留语义信息
计算与语言
2021-12-13 v1 计算机与社会
摘要
随着自然语言处理(NLP)在日常生活中的广泛部署,NLP 模型所继承的社会偏见已变得愈发严重且成问题。先前研究表明,基于人工生成语料训练的词嵌入具有强烈的性别偏见,可在下游任务中产生歧视性结果。以往的去偏方法主要聚焦于对偏见的建模,仅隐式地考虑语义信息,而完全忽视了偏见与语义成分之间复杂的底层因果结构。为解决这些问题,我们提出一种利用因果推断框架有效去除性别偏见的新方法。所提方法使我们能够构建并分析促进性别信息流动的复杂因果机制,同时在词嵌入中保留完备的语义信息。我们全面的实验表明,所提方法在性别去偏任务中取得了最先进(state-of-the-art)的结果。此外,我们的方法在词相似性评估及各类外在下游 NLP 任务中均表现出更优性能。
引用
@article{arxiv.2112.05194,
title = {Word Embeddings via Causal Inference: Gender Bias Reducing and Semantic Information Preserving},
author = {Lei Ding and Dengdeng Yu and Jinhan Xie and Wenxing Guo and Shenggang Hu and Meichen Liu and Linglong Kong and Hongsheng Dai and Yanchun Bao and Bei Jiang},
journal= {arXiv preprint arXiv:2112.05194},
year = {2021}
}
备注
Accepted by AAAI 2022