中文

利用 ASCII 字符画逃避毒性检测:针对审核系统的空间攻击基准

计算与语言 2025-09-25 v5 人工智能 密码学与安全

摘要

我们引入了一类针对毒性检测模型的新型对抗攻击,该攻击利用了语言模型无法解释以 ASCII 字符画形式呈现的空间结构化文本的缺陷。为了评估这些攻击的有效性,我们提出了 ToxASCII,一个旨在评估毒性检测系统对视觉混淆输入鲁棒性的基准。我们的攻击在多种最先进的大型语言模型和专用审核工具上均实现了完美的攻击成功率(ASR),揭示了当前纯文本审核系统中的重大漏洞。

关键词

引用

@article{arxiv.2409.18708,
  title  = {Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems},
  author = {Sergey Berezin and Reza Farahbakhsh and Noel Crespi},
  journal= {arXiv preprint arXiv:2409.18708},
  year   = {2025}
}