MGT-Prism:通过谱对齐提升机器生成文本检测的领域泛化能力
计算与语言
2025-08-26 v2
摘要
大语言模型展现出日益增强的生成流畅且连贯文本的能力,这些文本与人类的写作风格高度相似。 当前的机器生成文本(MGT)检测器在训练和测试于同一领域时表现良好,但由于不同数据来源之间的领域迁移,难以泛化到未见领域。 本文提出了 MGT-Prism,一种从频域角度进行 MGT 检测的方法,以实现更好的领域泛化。 我们的关键洞察来自于分析文本在频域中的表示,我们观察到不同领域之间存在一致的谱模式,而 MGT 与人类撰写文本(HWT)之间在幅值上存在显著差异。 该观察促进了基于低频域过滤模块设计,用于过滤出对领域迁移敏感的文档级特征,以及动态谱对齐策略,以提取特定于任务且不受域限制的特征,以提高检测器在领域泛化方面的性能。 大量实验表明,MGT-Prism 在三个领域泛化场景中的 11 个测试数据集上,以 0.90% 的准确率提升和 0.92% 的 F1 分数超过最先进的基线方法。
引用
@article{arxiv.2508.13768,
title = {MGT-Prism: Enhancing Domain Generalization for Machine-Generated Text Detection via Spectral Alignment},
author = {Shengchao Liu and Xiaoming Liu and Chengzhengxu Li and Zhaohan Zhang and Guoxin Ma and Yu Lan and Shuai Xiao},
journal= {arXiv preprint arXiv:2508.13768},
year = {2025}
}