中文

面向理解自然语言处理中偏置相关性以进行缓解

计算与语言 2022-05-26 v1 人工智能

摘要

自然语言处理(NLP)模型已被发现对性别、种族等不同社会身份群体存在歧视。鉴于这些非预期偏置的负面后果,研究人员以空前的努力作出回应,并提出了有前景的偏置缓解方法。尽管具有相当的实际重要性,当前的算法公平文献仍缺乏对各类偏置之间关系的深入理解。社会偏置本质上复杂。社会心理学的大量研究指出了“广义偏见”,即跨不同群体的普遍贬低情绪。例如,贬低少数族裔的人也可能贬低女性和同性恋者。因此,本工作旨在提供一项面向理解缓解中偏置相关性的首次系统性研究。具体而言,我们在两个常见 NLP 任务——毒性检测和词嵌入——上,针对种族、性别和宗教三种社会身份考察偏置缓解。我们的发现表明偏置是相互关联的,并呈现出当前文献中占主导的独立去偏方法可能不足的情景。我们进一步探究联合缓解相关偏置是否比独立个体去偏更可取。最后,我们阐明了偏置缓解中固有的去偏-准确率权衡问题。本研究旨在激励未来考虑相关偏置的联合偏置缓解研究。

关键词

引用

@article{arxiv.2205.12391,
  title  = {Toward Understanding Bias Correlations for Mitigation in NLP},
  author = {Lu Cheng and Suyu Ge and Huan Liu},
  journal= {arXiv preprint arXiv:2205.12391},
  year   = {2022}
}

备注

11 pages, 5 figures