中文

LLM 易受伪装为科学语言的恶意提示攻击

计算与语言 2025-02-19 v2

摘要

随着大型语言模型(LLM)在 various 实际场景中的部署,关于其可能传播危害的担忧日益增长。已开发出各种越狱技术来暴露这些模型的漏洞并提高其安全性。本工作揭示了许多最先进的 LLM 都容易受到隐藏在科学语言背后的恶意请求的攻击。具体而言,我们对 GPT4o、GPT4o-mini、GPT-4、LLama3-405B-Instruct、Llama3-70B-Instruct、Cohere、Gemini 模型进行实验,证明这些模型在被恶意请求(这些请求故意将社会科学和心理学研究误解为支持刻板偏见益处的证据)所驱动时,其偏见和毒性会显著增加。令人警惕的是,这些模型还可以被操纵以生成声称偏见有益的虚构科学论证,这些论证可被恶意行为者用于系统性地越狱这些强大 LLM。我们的分析研究了导致模型对学术语言恶意请求脆弱性的各种因素。提及作者姓名和会议 venue 可增强模型的说服力,随着对话的进行,偏见得分会增加。我们的发现呼吁对使用科学数据训练 LLM 进行更仔细的调查。

关键词

引用

@article{arxiv.2501.14073,
  title  = {LLMs are Vulnerable to Malicious Prompts Disguised as Scientific Language},
  author = {Yubin Ge and Neeraja Kirtane and Hao Peng and Dilek Hakkani-Tür},
  journal= {arXiv preprint arXiv:2501.14073},
  year   = {2025}
}

备注

16 pages