风格池化:用于提升分类公平性的自动文本风格混淆
机器学习
2021-09-13 v1
摘要
文本风格会向读者揭示作者的特征(如种族或年龄),进而可能导致隐私侵犯,以及基于文本的人类和算法决策产生偏差。例如,求职申请中的写作风格可能会暴露候选人的受保护特征,这可能导致招聘决策中的偏差,无论该决策是由算法还是由人类做出。我们提出了一种基于 VAE 的框架,通过自动重写文本本身进行风格迁移,从而混淆人工生成文本的风格特征。我们的框架以灵活的方式实现了风格混淆的概念,支持两种不同的风格混淆概念:(1) 一种最小概念,有效地交集训练中见到的各种风格;(2) 一种最大概念,通过向文本添加所有敏感属性的风格特征来寻求混淆,实际上是计算风格的并集。我们的风格混淆框架可用于多种目的,但我们展示了其在提升下游分类器公平性方面的有效性。我们还在两域和三域风格混淆中,全面研究了风格池化对流畅性、语义一致性和文本属性去除的影响。
引用
@article{arxiv.2109.04624,
title = {Style Pooling: Automatic Text Style Obfuscation for Improved Classification Fairness},
author = {Fatemehsadat Mireshghallah and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:2109.04624},
year = {2021}
}
备注
EMNLP 2021