中文

VietBinoculars:一种检测越南语大语言模型生成文本的零样本方法

计算与语言 2025-10-01 v1

摘要

基于Transformer架构的大语言模型(LLMs)的快速发展带来了关键挑战,其中之一是区分人类撰写文本与LLM生成文本的任务。随着LLM生成的文本内容日益复杂,并逐渐接近人类写作,传统的检测方法正变得不那么有效,尤其是在LLM的数量和多样性持续增长、新模型和版本快速发布的情况下。本研究提出了VietBinoculars,这是对Binoculars方法的一种改进,通过优化全局阈值来增强对越南语LLM生成文本的检测。我们构建了新的越南语人工智能生成数据集,以确定VietBinoculars的最优阈值并进行基准测试。我们的实验结果表明,VietBinoculars在多个跨域数据集上的准确率、F1分数和AUC这三个指标上均超过99%。它优于原始的Binoculars模型、传统检测方法以及其他最先进的方法,包括ZeroGPT和DetectGPT等商业工具,尤其是在经过特殊修改的提示策略下。

关键词

引用

@article{arxiv.2509.26189,
  title  = {VietBinoculars: A Zero-Shot Approach for Detecting Vietnamese LLM-Generated Text},
  author = {Trieu Hai Nguyen and Sivaswamy Akilesh},
  journal= {arXiv preprint arXiv:2509.26189},
  year   = {2025}
}

备注

27 pages