中文

盲目撒谎:绕过 ChatGPT 安全机制生成难以检测的虚假信息主张

计算与语言 2024-12-10 v2

摘要

随着大型语言模型 (LLM) 日益精通,其在协同虚假信息活动中的滥用已成为日益严重的担忧。本研究探讨了配备 GPT-3.5 的 ChatGPT 生成关于乌克兰战争的短篇虚假信息主张的能力,包括一般情况和特定事件(后者超出了 GPT-3.5 的知识截止日期)。与以往工作不同,我们并未通过在提示中包含人类撰写的虚假信息叙述来向模型提供信息。因此,生成的短篇主张是基于先验世界知识和从极简提示中推断出的幻觉。通过一种直接的提示技术,我们能够绕过模型安全机制并生成大量短篇主张。我们将这些主张与 ClaimReview 中关于乌克兰战争的人类撰写虚假主张进行了比较,特别是针对其语言属性的差异。我们还评估了人类读者或最先进的作者身份检测工具是否能区分 AI 作者身份。因此,我们证明了 ChatGPT 能够产生逼真的、针对特定目标的虚假信息主张,即使是针对特定的截止日期后事件,且人类或现有自动化工具都无法可靠地将其区分开来。

关键词

引用

@article{arxiv.2402.08467,
  title  = {Lying Blindly: Bypassing ChatGPT's Safeguards to Generate Hard-to-Detect Disinformation Claims},
  author = {Freddy Heppell and Mehmet E. Bakir and Kalina Bontcheva},
  journal= {arXiv preprint arXiv:2402.08467},
  year   = {2024}
}