基于强化学习的 AuthorMist:规避 AI 文本检测器
密码学与安全
2025-03-13 v1 人工智能
机器学习
摘要
在强大 AI 生成文本的时代,自动检测器已出现用于识别机器编写的内容。这构成了对作者隐私和自由的威胁,因为使用 AI 辅助撰写的文本可能不公平地被标记为机器生成。我们提出 AuthorMist,一种基于强化学习的新型系统,用于将 AI 生成文本转化为类似人类的写作。AuthorMist 利用一个包含 30 亿参数的语言模型作为主干模型,通过基于群体相对策略优化 (GPRO) 的微调,实现对文本的 paraphrase 处理,以规避 AI 检测器。我们的框架建立了一个通用方法,其中外部检测器 API(如 GPTZero、WinstonAI、Originality.ai 等)作为强化学习循环中的奖励函数,使模型能够系统地学习输出,使得这些检测器更不可能将其分类为 AI 生成。这种 API 作为奖励的方法可以广泛应用于优化任何具有可访问接口的检测器。在多个数据集和检测器上的实验表明,AuthorMist 有效地降低了 AI 生成文本的可检测性,同时保持原始语义。我们的评估显示,该方法对单个检测器的攻击成功率介于 78.6% 至 96.2% 之间,显著优于基线 paraphrasing 方法。AuthorMist 保持高于 0.94 的语义相似度,成功规避检测。这些结果凸显了当前 AI 文本检测技术的局限性,并对检测-规避的赛跑持有质疑态度。
关键词
引用
@article{arxiv.2503.08716,
title = {AuthorMist: Evading AI Text Detectors with Reinforcement Learning},
author = {Isaac David and Arthur Gervais},
journal= {arXiv preprint arXiv:2503.08716},
year = {2025}
}