中文

StyleShield:通过连续可控风格迁移暴露 AIGC 检测器的脆弱性

机器学习 2026-05-05 v1 人工智能

摘要

AI 生成内容 (AIGC) 检测器正在被部署到学术诚信筛查等高风险场景,然而其可靠性依赖于根本性悖论:随着语言模型在人类编写的语料库上进行训练,AI 与人类写作之间的统计边界必然随模型改进而消散。商业激励进一步扭曲了这一格局——检测服务和“去 AI 化”工具常常处于同一供应链中,取而代之的往往是对内容质量的判断,而非内容来源。我们提出 StyleShield,即第一个针对条件文本风格迁移的流匹配框架,直接在连续 token 嵌入空间中通过带有零初始化跨注意力适配器的 DiT 主干实现,条件于冻结的 Qwen-7B 表示。推理时,我们采用 SDEdit 从图像合成中移植到文本嵌入,单个参数 gamma 提供平滑的规避-保存权衡。我们在多领域中文基准上测试,StyleShield 对训练检测器实现 94.6% 的规避,对三个未见检测器实现 >=99% 的规避,同时保持 0.928 的语义相似度。我们进一步引入 RateAudit,一种文档级调度算法,表明检测率裁决可被设置为任意值,直接质疑基于得分的评估可靠性。

关键词

引用

@article{arxiv.2605.00924,
  title  = {StyleShield: Exposing the Fragility of AIGC Detectors through Continuous Controllable Style Transfer},
  author = {Guantian Zheng},
  journal= {arXiv preprint arXiv:2605.00924},
  year   = {2026}
}

备注

12 pages, 5 figures. Code and model weights will be released upon acceptance