中文

大规模多语言研究 LLM 安全措施、个人化与虚假信息之间的相互作用

计算与语言 2025-10-30 v2

摘要

大型语言模型(LLM)能够生成类似人的虚假信息,但其在多语言和人口学背景下对此类内容进行个人化的能力尚未得到充分探索。本研究提出首个大规模、多语言的人格定向虚假信息生成分析。采用红队测试方法,我们以 324 个虚假叙事和 150 个人口学人格(国家、世代和政治取向的组合)为八个最先进 LLM 提供提示,覆盖四种语言——英语、俄语、葡萄牙语和印地语,形成包含 160 万个个人化虚假信息文本的 AI-TRAITS 数据集。结果表明,即使使用简单的个人化提示,所有研究中的 LLM 越线率都会提高最高可达 10 个百分点,并改变其语言和修辞模式,增强叙事的说服力。诸如 Grok 和 GPT 之类的模型的越线率和个人化得分均超过 85%。这些发现揭示了当前最先进 LLM 的关键漏洞,并为改进多语言和跨人口学背景下的安全对齐和检测策略提供了基础。

关键词

引用

@article{arxiv.2510.12993,
  title  = {A Multilingual, Large-Scale Study of the Interplay between LLM Safeguards, Personalisation, and Disinformation},
  author = {João A. Leite and Arnav Arora and Silvia Gargova and João Luz and Gustavo Sampaio and Ian Roberts and Carolina Scarton and Kalina Bontcheva},
  journal= {arXiv preprint arXiv:2510.12993},
  year   = {2025}
}