中文

通过公平感知集成消除文本安全分类器偏见

计算与语言 2024-10-23 v2 人工智能 机器学习

摘要

大型语言模型(LLM)的日益广泛使用,要求对LLM输入和输出的安全性提供高性能的防护措施。当这些防护措施在不平衡数据上训练时,可能会学习到社会偏见。我们提出一种轻量级的后处理方法,用于缓解封闭源文本安全分类器中的反事实公平性问题。我们的方法涉及构建一个不仅超越输入分类器并实现政策对齐的集成,同时充当消除偏见的正则化器。我们引入两种与阈值无关的指标来评估模型的反事实公平性,并展示了如何将这些指标与公平数据重加权(Fair Data Reweighting, FDW)结合使用以缓解偏见。我们创建了一个扩充后的OpenAI数据集和一个新的基于用户提示的模板化LLM生成数据集,这两个数据集在身份群体之间实现了反事实平衡,并覆盖了四个关键的安全领域;我们将致力于公开发布这些数据集。我们的结果表明,该方法在最小化模型性能影响的同时,显著提升了反事实公平性。

关键词

引用

@article{arxiv.2409.13705,
  title  = {Debiasing Text Safety Classifiers through a Fairness-Aware Ensemble},
  author = {Olivia Sturman and Aparna Joshi and Bhaktipriya Radharapu and Piyush Kumar and Renee Shelby},
  journal= {arXiv preprint arXiv:2409.13705},
  year   = {2024}
}