中文

大语言模型能否被蒙蔽?调查大语言模型中的漏洞

机器学习 2024-07-31 v1 密码学与安全

摘要

大型语言模型 (LLM) 的出现引起了广泛关注并在自然语言处理 (NLP) 的各个领域发挥了巨大作用。尽管其能力不言而喻,但尤其当这些漏洞可能导致高昂的后果时,识别和审查其漏洞至关重要。 LLM 训练的用于从医学文档中提供简洁摘要的模型就可能在默默的提示下明确泄露个人患者数据。这只是众多不幸的例子之一,进一步的研究仍在必要的理解其背后原因方面。本研究深入探讨了多个漏洞类别,包括模型漏洞、训练时漏洞、推理时漏洞,并讨论了缓解策略,包括“模型编辑”旨在修改 LLM 行为,以及“色谱团队”结合多种团队策略以增强 LLM 的韧性。本文将综合每个漏洞部分的发现结果,并提出新的研究和开发方向。通过理解当前漏洞的焦点,我们可以更好地anticipate and 缓解未来的风险,为更健壮和安全的 LLM 铺平道路。

关键词

引用

@article{arxiv.2407.20529,
  title  = {Can LLMs be Fooled? Investigating Vulnerabilities in LLMs},
  author = {Sara Abdali and Jia He and CJ Barberan and Richard Anarfi},
  journal= {arXiv preprint arXiv:2407.20529},
  year   = {2024}
}

备注

14 pages, 1 figure. arXiv admin note: text overlap with arXiv:2403.12503