DSIPA:基于情感不变模式发散分析检测 LLM 生成文本
计算与语言
2026-04-30 v1 人工智能
摘要
大语言模型(LLMs)的快速发展带来了新的安全挑战,尤其是在检测用于虚假信息、冒充和内容伪造的机器生成文本方面。大多数现有检测方法在面对对抗性扰动、改写攻击和领域迁移时鲁棒性差,往往需要限制性地访问模型参数或大量标记数据。为此,我们提出DSIPA,一个新颖的无训练框架,通过量化情感分布在受控风格变化下的稳定性来检测 LLM 生成内容。它基于 LLMs 在情感上更一致的输出,而人类编写的文本显示更大的情感波动这一观察。我们的框架以零样本、黑盒方式运行,利用两个无监督指标——情感分布一致性和情感分布保存——捕捉这些内在行为不对称,无需参数更新或访问概率。广泛实验在最先进的专有和开源模型上进行,包括 GPT-5.2、Gemini-1.5-pro、Claude-3 和 LLaMa-3.3。在新闻、编程代码、学生作文、学术论文和社区评论等五个领域的评估表明,DSIPA 在基线方法上实现 F1 检测分数提升最高可达49.89%。该框架在领域间展现出卓越的通用性,并对对抗条件具有强大的抵抗力,为在不断演变的 LLM 生态系统中提供了可靠且可解释的行为信号,以实现安全的内容识别。
引用
@article{arxiv.2604.26328,
title = {DSIPA: Detecting LLM-Generated Texts via Sentiment-Invariant Patterns Divergence Analysis},
author = {Siyuan Li and Aodu Wulianghai and Guangyan Li and Xi Lin and Qinghua Mao and Yuliang Chen and Jun Wu and Jianhua Li},
journal= {arXiv preprint arXiv:2604.26328},
year = {2026}
}