中文

衡量AI生成文本中的人类参与度:学术写作案例研究

计算与语言 2025-06-05 v1 人工智能

摘要

随着大型语言模型如ChatGPT和Claude的快速发展,内容创建经历了巨大进步。这一进步极大地增强了生活和工作的各个方面,但也对社会的某些领域产生了负面影响。最近的一项调查显示,近30%的大学生使用生成式AI帮助撰写学术论文和报告。大多数对策将AI生成文本的检测视为二元分类任务,因此鲁棒性不足。这种方法忽略了即使人机协作成为主流,内容生成中仍然存在人类参与。除了生成完整文本外,人们可能使用机器完成或修改文本。这种人类参与因案例而异,这使得二元分类方法不够理想。我们称这种情况为参与度检测混淆。我们提议将BERTScore作为衡量生成过程中人类参与度的指标,并基于BERT的回归模型训练一个多任务回归器,用于解决这一问题。为评估这种方法的有效性,我们模拟了学术场景并创建了一个反映各种人类参与度水平的连续数据集。我们检查的所有现有检测器在该数据集上均未能检测人类参与度的水平。然而,我们的方法成功实现了(F1得分为0.9423,回归器均方误差为0.004)。此外,该方法在不同生成模型之间展现了一定的普适性。我们的代码已公开:https://github.com/gyc-nii/CAS-CS-and-dual-head-detector

关键词

引用

@article{arxiv.2506.03501,
  title  = {Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing},
  author = {Yuchen Guo and Zhicheng Dou and Huy H. Nguyen and Ching-Chun Chang and Saku Sugawara and Isao Echizen},
  journal= {arXiv preprint arXiv:2506.03501},
  year   = {2025}
}

备注

IJCNN2025 accepted