中文

利用可解释性设计对抗攻击并评估仇恨言论检测模型的攻击鲁棒性

计算与语言 2023-05-31 v1 人工智能

摘要

社交媒体的出现引发了诸多伦理挑战,其中仇恨言论是最受关注的问题之一。研究者正试图借助仇恨言论检测并利用语言模型自动审核内容、促进文明话语。遗憾的是,近期研究揭示仇恨言论检测系统可能被对抗攻击误导,引发对其鲁棒性的担忧。尽管先前研究已分别探讨这些模型在对抗攻击下的鲁棒性及其可解释性,但尚未有探索二者交集的综合性研究。我们工作的新颖性在于结合这两个关键方面,利用可解释性识别潜在漏洞并支持设计针对性对抗攻击。我们呈现了多种仇恨言论检测模型所展现对抗鲁棒性的综合比较分析。我们的研究利用可解释性技术评估这些模型抵御对抗攻击的韧性。为洞察模型决策过程,我们采用局部可解释模型无关解释(Local Interpretable Model-agnostic Explanations, LIME)框架。基于 LIME 获得的可解释性结果,我们借助 TextAttack 工具设计并执行了针对文本的定向攻击。我们的发现增进了对 SOTA 仇恨言论检测模型所展现漏洞与优势的理解。本工作强调了在此类模型的开发与评估中纳入可解释性以提升其对抗攻击韧性的重要性。最终,本工作为创建更鲁棒、更可靠的仇恨言论检测系统铺平道路,从而培育更安全的网络环境并促进社交媒体平台上的伦理话语。

关键词

引用

@article{arxiv.2305.18585,
  title  = {Exploiting Explainability to Design Adversarial Attacks and Evaluate Attack Resilience in Hate-Speech Detection Models},
  author = {Pranath Reddy Kumbam and Sohaib Uddin Syed and Prashanth Thamminedi and Suhas Harish and Ian Perera and Bonnie J. Dorr},
  journal= {arXiv preprint arXiv:2305.18585},
  year   = {2023}
}