关于机器生成文本检测在学术写作中的泛化与适应能力
人工智能
2025-08-05 v3 计算与语言
摘要
大语言模型(LLM)的流行使机器生成文本(MGT)引发担忧,尤其在学术场景下涉及剽窃与误导等问题。因此,开发高度通用且可适应的MGT检测系统已成为紧迫任务。鉴于LLM最常被滥用于学术写作,本文从三个聚焦学术写作的关键方面考察MGT检测器的泛化与适应能力:其一,构建MGT-Acedemic大规模数据集,包含3360亿token和74.9万样本,涵盖STEM、人文与社会科学等领域的HWTs与MGTs,并配套可扩展的代码框架以实现高效基准测试。其二,对各类检测器在in-domain与cross-domain设置下进行基准测试,进行二分类与归因任务。这一基准暴露了归因任务常被忽视的挑战。其三,引入新型归因任务,即模型需在有限甚至几乎没有前期训练数据的情况下适应新类别。我们实现了八种不同的适应技术以提升性能,并强调该任务的内在复杂性。我们的发现为MGT检测器在多样场景下的泛化与适应能力提供了洞见,为构建稳健、可适应的检测系统奠定了基础。代码框架已公开于https://github.com/Y-L-LIU/MGTBench-2.0。
引用
@article{arxiv.2412.17242,
title = {On the Generalization and Adaptation Ability of Machine-Generated Text Detectors in Academic Writing},
author = {Yule Liu and Zhiyuan Zhong and Yifan Liao and Zhen Sun and Jingyi Zheng and Jiaheng Wei and Qingyuan Gong and Fenghua Tong and Yang Chen and Yang Zhang and Xinlei He},
journal= {arXiv preprint arXiv:2412.17242},
year = {2025}
}