TH-Bench:评估通过人形化AI文本化解对机器生成文本检测器的逃避攻击
密码学与安全
2025-03-14 v2 人工智能
摘要
随着大型语言模型(LLM)的不断发展,机器生成文本(MGT)已变得越来越流畅、高质量且信息丰富。现有的广泛范围机器生成文本检测器旨在识别MGT,以防止抄袭和虚假信息的传播。然而,对手会尝试对MGT进行人形化处理以规避检测(称为逃避攻击),这只需对检测器进行微小修改即可。然而,现有的攻击方法缺乏统一且全面的评估框架,因为它们使用的实验设置、模型架构和数据集各不相同。为填补这一空白,我们引入文本人形化基准(TH-Bench),这是第一个用于评估对机器生成文本检测器逃避攻击的全面基准。TH-Bench在三个关键维度上评估攻击方法:逃避效果、文本质量和计算开销。我们对6种最先进的攻击方法在13个机器生成文本检测器上进行了广泛实验,涵盖6个数据集,跨19个领域,由11个广泛使用的LLM生成。我们的发现表明,没有单一的逃避攻击方法在所有三个维度上都表现出色。通过深入分析,我们概述了不同攻击方法的优势与局限性。更重要的是,我们识别出三个维度之间存在权衡,并提出了两种优化思路。通过初步实验,我们验证了这些思路的正确性和有效性,为未来研究提供了潜在方向。
引用
@article{arxiv.2503.08708,
title = {TH-Bench: Evaluating Evading Attacks via Humanizing AI Text on Machine-Generated Text Detectors},
author = {Jingyi Zheng and Junfeng Wang and Zhen Sun and Wenhan Dong and Yule Liu and Xinlei He},
journal= {arXiv preprint arXiv:2503.08708},
year = {2025}
}