中文

fairBERTs:通过语义与公平性感知扰动擦除敏感信息

计算与语言 2024-07-12 v1 人工智能

摘要

预训练语言模型(PLMs)已彻底革新了自然语言处理领域的研究和应用。然而,编码在预训练语言模型中的刻板印象(如性别和种族歧视)引发了负面的伦理问题,这严重限制了其更广泛的应用。为此,我们提出了 fairBERTs,一个通过生成对抗网络生成的语义扰动和公平性感知扰动来擦除受保护的敏感信息,从而学习更公平的微调 BERT 系列模型的通用框架。通过对两个真实任务的大量定性和定量实验,我们展示了 fairBERTs 在缓解不公平性方面具有显著优势,同时保持模型实用性。我们还验证了将 fairBERTs 中的对抗组件迁移到其他常规训练的 BERT 类模型以实现公平性改进的可行性。我们的发现或为进一步构建更公平的微调预训练语言模型提供了指引。

关键词

引用

@article{arxiv.2407.08189,
  title  = {fairBERTs: Erasing Sensitive Information Through Semantic and Fairness-aware Perturbations},
  author = {Jinfeng Li and Yuefeng Chen and Xiangyu Liu and Longtao Huang and Rong Zhang and Hui Xue},
  journal= {arXiv preprint arXiv:2407.08189},
  year   = {2024}
}