攻击神经文本检测器
密码学与安全
2022-01-20 v4 计算与语言
摘要
基于机器学习的语言模型近期取得显著进展,这也带来了传播错误信息的隐患。为应对这一潜在危险,已有若干用于检测这些语言模型所写文本的方法被提出。本文提出两类针对此类检测器的黑盒攻击:一类将字符随机替换为同形字(homoglyph),另一类为一种故意拼错单词的简单方案。同形字与拼错攻击将一种流行的神经文本检测器的神经文本召回率分别从 97.44% 降至 0.26% 与 22.68%。结果还表明,这些攻击可迁移至其他神经文本检测器。
引用
@article{arxiv.2002.11768,
title = {Attacking Neural Text Detectors},
author = {Max Wolff and Stuart Wolff},
journal= {arXiv preprint arXiv:2002.11768},
year = {2022}
}
备注
Accepted at the ICLR 2020 workshop "Towards Trustworthy ML: Rethinking Security and Privacy for ML."