中文

人类与机器文本的风格分析用于学术诚信

计算与语言 2026-01-06 v1 人工智能

摘要

本工作针对学术诚信中的诸多挑战,包括抄袭、造假及教育内容作者身份验证,提出一种基于自然语言处理(NLP)的框架,通过作者归属和风格变化检测来验证学生内容的真实性。与现有方法不同,本文通过针对四个相关任务进行全面分析:(1)人类文本与机器生成文本的分类;(2)在单篇和多作者文档中进行区分;(3)检测多作者文档中的作者变化;(4)在协作生产的文档中进行作者识别。针对上述任务提出的解决方案在使用 Gemini 生成的两个数据集上进行评估,这两个数据集分别包含一个正常提示和一个严格指令集合。在实验过程中,在通过严格提示生成的数据集上,所提出解决方案的性能出现一定下降,表明了检测经过精心设计提示下的机器生成文本所面临的复杂性。生成的数据集、代码及其他相关材料已公开于 GitHub,预计为该领域的后续研究提供基准。

关键词

引用

@article{arxiv.2601.01225,
  title  = {Stylometry Analysis of Human and Machine Text for Academic Integrity},
  author = {Hezam Albaqami and Muhammad Asif Ayub and Nasir Ahmad and Yaseen Ahmad and Mohammed M. Alqahtani and Abdullah M. Algamdi and Almoaid A. Owaidah and Kashif Ahmad},
  journal= {arXiv preprint arXiv:2601.01225},
  year   = {2026}
}

备注

16 pages, 9 tables, 3 figures