中文

基于攻击目标视角下的大型语言模型对抗性景观

密码学与安全 2025-02-06 v1

摘要

大型语言模型(LLM)代表着人工智能的一种变革性进步,使其能够在前所未有的规模上理解、生成和细粒度地与人类语言进行交互。然而,LLM 正日益暴露于各种对抗性攻击,这些攻击威胁其隐私、可靠性、安全性和可信度。这些攻击可以扭曲输出、注入偏见、泄露敏感信息,或干扰 LLM 的正常功能,在 various applications 中构成重大挑战。在本文中,我们通过聚焦攻击目标的角度,对 LLM 的对抗性景观进行新的全面分析。通过聚焦对抗行为者的核心目标,我们提供了一种新颖的视角,检查从隐私、完整性、可用性和滥用等角度审视威胁,超越仅关注攻击技术的传统分类框架。这种以目标为导向的对抗性景观不仅揭示了不同对抗方法背后的战略意图,也揭示了这些威胁不断演变的性质以及当前防御措施的有效性。我们的分析旨在帮助研究人员和实践者更好地理解、预见并缓解这些攻击,从而最终促进开发更具韧性和鲁棒性的 LLM 系统。

关键词

引用

@article{arxiv.2502.02960,
  title  = {Large Language Model Adversarial Landscape Through the Lens of Attack Objectives},
  author = {Nan Wang and Kane Walter and Yansong Gao and Alsharif Abuadbba},
  journal= {arXiv preprint arXiv:2502.02960},
  year   = {2025}
}

备注

15 pages