中文

别傻了:针对用户意图对抗攻击的冒犯性语言检测中的池化策略

计算与语言 2024-03-26 v1

摘要

冒犯性语言检测是过滤辱骂性表达和改善在线用户体验的重要任务。然而,恶意用户常通过引入文本噪声来试图规避过滤系统。在本文中,我们将这些规避行为定义为用户意图的对抗攻击,这些攻击插入特殊符号或利用韩语的独特特征。此外,我们引入了简单但有效的逐层池化策略来防御所提出的攻击,重点关注前几层而不仅仅是最后一层,以同时捕获冒犯性和词元嵌入。我们证明,即使攻击率增加,这些池化策略对性能下降更具鲁棒性,而无需直接训练此类模式。值得注意的是,我们发现,通过采用这些池化策略,在干净文本上预训练的模型在检测受攻击的冒犯性语言方面可以达到与在噪声文本上预训练的模型相当的性能。

关键词

引用

@article{arxiv.2403.15467,
  title  = {Don't be a Fool: Pooling Strategies in Offensive Language Detection from User-Intended Adversarial Attacks},
  author = {Seunguk Yu and Juhwan Choi and Youngbin Kim},
  journal= {arXiv preprint arXiv:2403.15467},
  year   = {2024}
}

备注

NAACL 2024 Findings; Camera-Ready Version