中文

面向欺骗检测器的语言模型仍具有独特风格(以及如何改变它)

计算与语言 2025-09-30 v2 人工智能 机器学习

摘要

尽管在机器文本检测器的开发取得了显著进展,但有人认为这一问题本质上很难解决,因此应该假设机器生成的文本无法可靠地被检测为机器生成。我们检验了 Nicks 等人(2024)近期论文中关于语言模型如何被优化以降低机器文本检测器性能的主张。我们识别出一种特征空间——风格特征空间——对此类优化具有鲁棒性,并展示了可用于可靠检测被优化以防止检测的语言模型样本的方法。此外,我们表明即使在模型被明确优化以对抗风格检测器时,检测性能仍然出乎意料地不受影响。我们随后探讨了风格检测器是否本质上更具鲁棒性。为研究此问题,我们探索了一种新的 paraphrasing 方法,旨在同时缩小人类写作与机器写作在风格特征空间中的差距,同时避免使用传统特征进行检测。我们表明,当仅提供单个样本进行检测时,这种攻击对所有考虑的检测器(包括使用写作风格的检测器)都普遍有效。然而,随着用于检测的样本数量增加,人类和机器分布变得可区分。总体而言,我们的发现强化了前述建议,建议不要依赖机器文本检测。

关键词

引用

@article{arxiv.2505.14608,
  title  = {Language Models Optimized to Fool Detectors Still Have a Distinct Style (And How to Change It)},
  author = {Rafael Rivera Soto and Barry Chen and Nicholas Andrews},
  journal= {arXiv preprint arXiv:2505.14608},
  year   = {2025}
}