中文

迈向对语言模型生成文本的鲁棒检测:ChatGPT 真那么易检测吗?

计算与语言 2023-06-12 v1

摘要

自然语言处理(NLP)的最新进展催生了 ChatGPT 等大型语言模型(LLM)。本文提出一种用于开发与评估法语 ChatGPT 检测器的方法,重点考察其在域外数据及常见攻击手段下的鲁棒性。所提方法包括将英文数据集翻译为法语并在翻译数据上训练分类器。结果表明,检测器能有效检测 ChatGPT 生成文本,在域内设置下对基础攻击技术具有一定鲁棒性。然而在域外情境中漏洞明显,凸显了对抗文本检测的挑战。本研究强调将域内测试结果应用于更广泛内容时需谨慎。我们提供翻译后的数据集与模型作为开源资源。https://gitlab.inria.fr/wantoun/robust-chatgpt-detection

关键词

引用

@article{arxiv.2306.05871,
  title  = {Towards a Robust Detection of Language Model Generated Text: Is ChatGPT that Easy to Detect?},
  author = {Wissam Antoun and Virginie Mouilleron and Benoît Sagot and Djamé Seddah},
  journal= {arXiv preprint arXiv:2306.05871},
  year   = {2023}
}

备注

Accepted to TALN 2023