中文

StyleDecipher:基于风格分析的 LLM 生成文本鲁棒可解释检测方法

计算与语言 2025-10-15 v1 人工智能

摘要

随着大语言模型(LLM)在开放领域写作中的广泛集成,检测机器生成文本已成为确保内容真实性和可信度的关键任务。现有方法依赖统计偏差或模型特定的启发式规则来区分 LLM 生成文本与人类撰写的文本。然而,这些方法在实际场景下难以实现广泛泛化,容易受到改写攻击,且缺乏可解释性,尤其在面对风格多样性或人机混合创作时表现不足。本文提出 StyleDecipher,一个鲁棒且可解释的检测框架,通过组合特征提取器来量化风格差异,重新审视 LLM 生成文本检测问题。该框架联合建模离散风格指标和由语义嵌入派生的连续风格表征,在统一的表示空间中捕捉人类输出与 LLM 输出之间的风格层面的独特差异。该框架实现了准确、可解释且跨领域的检测,无需访问模型内部或标记化段落。广泛的实验覆盖新闻、代码、论文、评论和学术摘要等五个多样化领域,显示 StyleDecipher 在各领域均实现了最新领域准确率。此外,在跨领域评估中,它相较于现有基线提升了最高可达 36.30%,同时对对抗性扰动和混合人类 AI 内容保持鲁棒性。进一步的定性和定量分析确认,风格信号为区分机器生成文本提供了可解释的证据。我们的源代码可在 https://github.com/SiyuanLi00/StyleDecipher 查阅。

关键词

引用

@article{arxiv.2510.12608,
  title  = {StyleDecipher: Robust and Explainable Detection of LLM-Generated Texts with Stylistic Analysis},
  author = {Siyuan Li and Aodu Wulianghai and Xi Lin and Guangyan Li and Xiang Chen and Jun Wu and Jianhua Li},
  journal= {arXiv preprint arXiv:2510.12608},
  year   = {2025}
}