中文

面向文本数据的可解释偏见缓解:在保持分类性能的同时减少病历中的性别偏见

计算与语言 2021-03-11 v1 机器学习

摘要

一般而言医疗系统,尤其是患者治疗决策与结果,会受到基于性别及其他人口统计学因素的偏见影响。随着语言模型日益应用于医学领域,将算法公平性构建到影响患者护理的流程中正引起越来越多的关注。解决该问题的大量工作聚焦于语言模型中编码的偏见——从语料远读推导出的概念间关系的统计估计。在此工作基础上,我们探究医疗从业者所做的词语选择与语言模型在偏见方面如何相互作用。我们从两个临床笔记数据集中识别并移除性别化语言,并描述了一种基于BERT的性别分类器的新型去偏流程。我们展示通过数据增强在低至中度偏见移除水平下,健康状态分类任务的性能退化极小。最后,我们将语言模型中语义编码的偏见与在健康记录中经验观察到的偏见进行比较。本工作概述了一种利用数据增强识别并降低自然语言处理流水线中偏见潜力的可解释方法。

关键词

引用

@article{arxiv.2103.05841,
  title  = {Interpretable bias mitigation for textual data: Reducing gender bias in patient notes while maintaining classification performance},
  author = {Joshua R. Minot and Nicholas Cheney and Marc Maier and Danne C. Elbers and Christopher M. Danforth and Peter Sheridan Dodds},
  journal= {arXiv preprint arXiv:2103.05841},
  year   = {2021}
}

备注

31 pages, 22 figures