中文

放大而非学习:精调AI文本检测器放大了预训练方向

机器学习 2026-05-22 v1 人工智能 计算与语言

摘要

AI文本检测器放大了预训练的典型性轴;它们并未构建AI与人类之间的边界。在任何任务监督之前,对原始编码器进行投影即可实现NYT与HC3的AUROC为0.806/0.944/0.834(跨三种架构),在RoBERTa-base上,原始投影超过精调;全精调反而在两种流畅正式人群中低于原始。在非母语ESL写作上,该轴方向反转(AUROC 0.06-0.20)——这是典型性解读独有的可验证预测。一个 frozen probe仅用24个样本即可匹配全精调(0.900 vs 0.895)。闭形式Jacobian预测器参数化轴干扰干预,R²=1.000通用,使ELECTRA-CE部署TPR从0.000提升至0.904(FPR=1%),并可迁移至三个独立训练的第三方RoBERTa检测器中16/16 oracle等效(NYT-FPR降低57%)。范围:编码器族;机制规模HC3锚定;群体水平共享轴,单文本机制在不同架构中各异。三个操作上不同的探针——文本表面caps_rate残差化、几何signed-epsilon剥离、闭形式文本对预测器——在三种架构上在cos 0.74/0.81/1.00处一致,确认观察者不变性。在匹配TPR-0.90评估下,已发表的干预库(CC、dealign-f2c)在27个单元上校准等效(|Delta AUROC| <= 0.0081),且>=97%的LoRA->全精调偏差归因于校准迁移,而非学习到的表征——这一核心论点的预测已被证实。

关键词

引用

@article{arxiv.2605.21653,
  title  = {Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction},
  author = {Alexander Smirnov},
  journal= {arXiv preprint arXiv:2605.21653},
  year   = {2026}
}