中文

增强学术写作中 LLM 合成文本检测器的鲁棒性:综合分析与改进

计算与语言 2024-01-17 v1 人工智能

摘要

大型语言模型 (LLM)(如 ChatGPT 使用的 Generative Pre-trained Transformer 4 (GPT-4))的出现对学术界及更广泛的社区产生了深远影响。虽然这些模型在革新工作和学习方法方面提供了诸多优势,但也因其潜在的负面后果而引起了广泛关注。其中一个例子是生成几乎没有人类贡献的学术报告或论文。因此,研究人员致力于开发检测器以解决 LLM 的滥用问题。然而,大多数现有方法优先在受限数据集上实现更高的准确率,却忽视了泛化能力这一关键方面。这种局限性阻碍了它们在可靠性至关重要的现实生活场景中的实际应用。在本文中,我们全面分析了提示词对 LLM 生成文本的影响,并强调了当前最先进 GPT 检测器之一可能缺乏鲁棒性的问题。为了缓解学术写作中 LLM 滥用带来的这些问题,我们提出了一种名为 Synthetic-Siamese 的基于参考的孪生检测器,该检测器接收一对文本,一个作为查询,另一个作为参考。我们的方法有效解决了先前检测器(OpenAI detector 和 DetectGPT)缺乏鲁棒性的问题,并在真实的学术写作场景中将基线性能显著提高了约 67% 至 95%。

关键词

引用

@article{arxiv.2401.08046,
  title  = {Enhancing Robustness of LLM-Synthetic Text Detectors for Academic Writing: A Comprehensive Analysis},
  author = {Zhicheng Dou and Yuchen Guo and Ching-Chun Chang and Huy H. Nguyen and Isao Echizen},
  journal= {arXiv preprint arXiv:2401.08046},
  year   = {2024}
}