针对神经文本检测器的高效黑盒对抗攻击
计算与语言
2023-11-06 v1
摘要
神经文本检测器是经训练用于检测给定文本是由语言模型生成还是由人类撰写的模型。在本文中,我们研究了三种简单且资源高效的策略(参数微调、提示工程与字符级变异)来改动由 GPT-3.5 生成的、对人类而言不可疑或不明显的文本,但会导致神经文本检测器误分类。结果表明,尤其是参数微调与字符级变异是有效的策略。
引用
@article{arxiv.2311.01873,
title = {Efficient Black-Box Adversarial Attacks on Neural Text Detectors},
author = {Vitalii Fishchuk and Daniel Braun},
journal= {arXiv preprint arXiv:2311.01873},
year = {2023}
}
备注
Accepted at ICNLSP 2023