中文

通过鲁棒性实现文本分类中的反事实公平性

机器学习 2019-02-15 v2 机器学习

摘要

在本文中,我们研究文本分类中的反事实公平性,其提出的问题是:如果示例中引用的敏感属性不同,预测会如何变化?毒性分类器存在一种反事实公平性问题,其预测“Some people are gay”为有毒,而“Some people are straight”为无毒。我们提出一种度量——反事实词元公平性(counterfactual token fairness, CTF),用于衡量文本分类器中这种特定形式的公平性,并描述其与群体公平性的关系。此外,我们提出三种方法——盲化、反事实增强和反事实逻辑配对(counterfactual logit pairing, CLP)——用于在训练期间优化反事实词元公平性,从而将鲁棒性与公平性文献联系起来。在实证上,我们发现盲化和 CLP 能解决反事实词元公平性。这些方法不会损害分类器性能,并与群体公平性存在不同的权衡。这些用于度量和优化的方法,为解决文本分类中的公平性担忧提供了一条新路径。

关键词

引用

@article{arxiv.1809.10610,
  title  = {Counterfactual Fairness in Text Classification through Robustness},
  author = {Sahaj Garg and Vincent Perot and Nicole Limtiaco and Ankur Taly and Ed H. Chi and Alex Beutel},
  journal= {arXiv preprint arXiv:1809.10610},
  year   = {2019}
}