中文

评估 LLM 被滥用于个性化虚假信息生成的漏洞

计算与语言 2025-07-28 v2 人工智能 计算机与社会

摘要

近期大型语言模型(LLM)生成人类难以分辨的高质量内容的能力,引发了人们对其被滥用的诸多担忧。先前的研究表明,LLM 可以被有效地滥用于按照预设叙事生成虚假信息新闻文章。它们生成个性化(在各个方面)内容的能力也已得到评估,且大多被认为可用。然而,LLM 的个性化与虚假信息生成能力的结合尚未得到全面研究。如果存在安全过滤器,这种危险的组合应当触发 LLM 的集成安全过滤器。本研究通过评估近期开源和闭源 LLM 的漏洞,及其生成英文个性化虚假信息新闻文章的意愿,填补了这一空白。我们进一步探讨了 LLM 是否能可靠地元评估个性化质量,以及个性化是否会影响生成文本的可检测性。我们的结果表明需要更强的安全过滤器和免责声明,因为大多数受评估的 LLM 中的这些机制未能正常运作。此外,我们的研究揭示,个性化实际上降低了安全过滤器的激活率;从而起到了越狱的作用。LLM 开发者和服务提供商必须紧急应对此类行为。

关键词

引用

@article{arxiv.2412.13666,
  title  = {Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation},
  author = {Aneta Zugecova and Dominik Macko and Ivan Srba and Robert Moro and Jakub Kopal and Katarina Marcincinova and Matus Mesarcik},
  journal= {arXiv preprint arXiv:2412.13666},
  year   = {2025}
}

备注

ACL 2025 main