中文

超越检测:揭示滥用语言模型中的公平性漏洞

计算与语言 2023-12-07 v2 人工智能 计算机与社会 机器学习

摘要

本工作研究了在滥用语言检测中同时损害公平性与检测性能的潜在可能。在动态而复杂的数字世界中,研究这些检测模型对对抗性公平性攻击的漏洞以提升其公平性鲁棒性至关重要。我们提出了一种简单而有效的框架 FABLE,其利用后门攻击,因为后门攻击允许对公平性和检测性能进行针对性控制。FABLE 探索了三类触发器设计(即稀有、人工和自然触发器)以及新颖的采样策略。具体而言,攻击者可将触发器注入具有偏好结果(即“非滥用”)的少数群体样本中,并将其标签翻转为非偏好结果,即“滥用”。在基准数据集上的实验证明了 FABLE 攻击滥用语言检测中公平性与效用的有效性。

关键词

引用

@article{arxiv.2311.09428,
  title  = {Beyond Detection: Unveiling Fairness Vulnerabilities in Abusive Language Models},
  author = {Yueqing Liang and Lu Cheng and Ali Payani and Kai Shu},
  journal= {arXiv preprint arXiv:2311.09428},
  year   = {2023}
}

备注

Under review