中文

LLM 生成的错误信息能否被检测?

计算与语言 2024-04-25 v5 人工智能 密码学与安全 人机交互 机器学习

摘要

大语言模型(LLMs)的出现带来了变革性影响。然而,ChatGPT 等 LLM 可能被利用来生成错误信息的潜力,已对在线安全与公众信任构成严重关切。一个基础研究问题是:LLM 生成的错误信息是否会比人类撰写的错误信息造成更大危害?我们提议从检测难度的视角来解决此问题。我们首先构建 LLM 生成错误信息的分类体系。随后我们归类并验证了利用 LLM 生成错误信息的潜在现实方法。接着,通过广泛的实证调研,我们发现相较于语义相同的人类撰写错误信息,LLM 生成的错误信息对人类与检测器都更难检测,这表明其可能具有更具欺骗性的风格并潜在造成更大危害。我们还讨论了该发现对 LLM 时代抗击错误信息的启示与对策。

关键词

引用

@article{arxiv.2309.13788,
  title  = {Can LLM-Generated Misinformation Be Detected?},
  author = {Canyu Chen and Kai Shu},
  journal= {arXiv preprint arXiv:2309.13788},
  year   = {2024}
}

备注

Accepted to Proceedings of ICLR 2024. 9 pages for main paper, 40 pages including appendix. The code, results, dataset for this paper and more resources on "LLMs Meet Misinformation" have been released on the project website: https://llm-misinformation.github.io/