中文

NLPGuard:缓解 NLP 分类器中受保护属性使用的框架

计算与语言 2024-11-19 v1 人工智能 人机交互

摘要

AI 法规预计将禁止机器学习模型在训练期间使用敏感属性。然而,最新的自然语言处理 (NLP) 分类器依赖深度学习,作为黑箱系统, complicates the detection and remediation of such misuse. 传统的 NLP 中的偏见缓解方法旨在基于类似性别或种族的属性,在不同群体之间实现相当的性能,但未能解决对受保护属性依赖的根本问题。为部分解决此问题,我们引入 NLPGuard,一个缓解 NLP 分类器中对受保护属性依赖性的框架。NLPGuard 输入为无标签数据集、现有的 NLP 分类器及其训练数据,输出显著降低对受保护属性依赖性而不牺牲准确性的修改后训练数据集。NLPGuard 应用于三个分类任务:识别有害语言、情感分析和职业分类。我们的评估显示,当前的 NLP 分类器高度依赖受保护属性,其中最高达 23%23\% 的最具预测性词语与这些属性相关。然而,NLPGuard 有效地将其依赖性降低最高 79%79\%,同时略微提高了准确性。

关键词

引用

@article{arxiv.2407.01697,
  title  = {NLPGuard: A Framework for Mitigating the Use of Protected Attributes by NLP Classifiers},
  author = {Salvatore Greco and Ke Zhou and Licia Capra and Tania Cerquitelli and Daniele Quercia},
  journal= {arXiv preprint arXiv:2407.01697},
  year   = {2024}
}

备注

Paper accepted at CSCW 2024