通过鲁棒性实现文本分类中的反事实公平性
机器学习
2019-02-15 v2 机器学习
摘要
在本文中,我们研究文本分类中的反事实公平性,其提出的问题是:如果示例中引用的敏感属性不同,预测会如何变化?毒性分类器存在一种反事实公平性问题,其预测“Some people are gay”为有毒,而“Some people are straight”为无毒。我们提出一种度量——反事实词元公平性(counterfactual token fairness, CTF),用于衡量文本分类器中这种特定形式的公平性,并描述其与群体公平性的关系。此外,我们提出三种方法——盲化、反事实增强和反事实逻辑配对(counterfactual logit pairing, CLP)——用于在训练期间优化反事实词元公平性,从而将鲁棒性与公平性文献联系起来。在实证上,我们发现盲化和 CLP 能解决反事实词元公平性。这些方法不会损害分类器性能,并与群体公平性存在不同的权衡。这些用于度量和优化的方法,为解决文本分类中的公平性担忧提供了一条新路径。
引用
@article{arxiv.1809.10610,
title = {Counterfactual Fairness in Text Classification through Robustness},
author = {Sahaj Garg and Vincent Perot and Nicole Limtiaco and Ankur Taly and Ed H. Chi and Alex Beutel},
journal= {arXiv preprint arXiv:1809.10610},
year = {2019}
}