中文

伤害性词语:临床上下文词嵌入中的偏见量化

计算与语言 2020-03-26 v1 计算机与社会 机器学习 机器学习

摘要

在本工作中,我们考察词嵌入在多大程度上可能对边缘化群体进行差异化编码,以及这如何导致偏见的延续与临床任务性能的下降。我们在 MIMIC-III 医院数据集的医疗记录上预训练深度嵌入模型(BERT),并使用两种方法量化潜在差异。首先,我们利用来自真实临床记录的文本与对数概率偏见分数量化,通过填空方法识别上下文词嵌入所捕获的危险潜在关联。其次,我们在包含急性与慢性疾病检测的 50 余项下游临床预测任务上,依据不同的公平性定义评估性能差距。我们发现,由 BERT 表示训练的分类器表现出统计显著的性能差异,常偏向于性别、语言、种族与保险状态上的多数群体。最后,我们探讨了使用对抗去偏来混淆上下文词嵌入中子群信息的不足,并推荐了此类深度嵌入模型在临床环境中的最佳实践。

关键词

引用

@article{arxiv.2003.11515,
  title  = {Hurtful Words: Quantifying Biases in Clinical Contextual Word Embeddings},
  author = {Haoran Zhang and Amy X. Lu and Mohamed Abdalla and Matthew McDermott and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2003.11515},
  year   = {2020}
}

备注

Accepted at ACM CHIL 2020 (Spotlight)