面向含身份信息的文本分类任务的公平性:基于身份数据增强方法
计算与语言
2022-03-08 v1 人工智能
摘要
反事实公平性方法解决如下问题:若文本实例中引用的敏感身份属性不同,预测会如何变化?这些方法完全基于对给定训练与测试集实例生成反事实。反事实实例通常通过替换敏感身份术语来制备,即实例中出现的身份术语被替换为同属该敏感类别的其他身份术语。因此,这些方法的有效性严重依赖于身份对的质量和完备性。本文提出一种两步数据增强流程,其中(1)前阶段包含一种利用词嵌入制备完备身份对列表的新方法,(2)后阶段利用制备好的身份对列表,通过三种简单操作(即身份对替换、身份术语遮蔽和身份对交换)增强训练实例。我们经实证表明,该两阶段增强流程带来了多样化的身份对和增强的训练集,并在两个知名文本分类任务上提升了基于反事实词的公平性指标得分。
引用
@article{arxiv.2203.03541,
title = {Fairness for Text Classification Tasks with Identity Information Data Augmentation Methods},
author = {Mohit Wadhwa and Mohan Bhambhani and Ashvini Jindal and Uma Sawant and Ramanujam Madhavan},
journal= {arXiv preprint arXiv:2203.03541},
year = {2022}
}