面向自然语言处理的人导公平分类
计算与语言
2023-03-17 v2 人工智能
计算机与社会
机器学习
摘要
文本分类器在简历筛选和内容审核等高风险任务中具有广阔应用前景。这些分类器必须公平,并通过对于性别或种族等敏感属性的扰动保持不变来避免歧视性决策。然而,人类关于这些扰动的直觉与捕捉它们的形式化相似性规范之间存在差距。尽管现有研究已开始解决这一差距,当前方法基于硬编码的词替换,导致规范表达力有限或未能完全与人类直觉对齐(例如在非对称反事实的情况下)。本工作提出通过发现具有表达力且直观的个体公平规范来弥合这一差距的新方法。我们展示如何利用无监督风格迁移和 GPT-3 的零样本能力自动生成在敏感属性上不同但语义相似的表达性候选句子对。然后我们通过广泛的众包研究验证生成的句子对,确认其中许多对在毒性分类背景下与人类关于公平的直觉一致。最后,我们展示如何利用有限数量的人类反馈来学习可用于训练下游公平感知模型的相似性规范。
引用
@article{arxiv.2212.10154,
title = {Human-Guided Fair Classification for Natural Language Processing},
author = {Florian E. Dorner and Momchil Peychev and Nikola Konstantinov and Naman Goel and Elliott Ash and Martin Vechev},
journal= {arXiv preprint arXiv:2212.10154},
year = {2023}
}
备注
Published at ICLR 2023 (notable top 25%). 30 pages, 1 figure