中文

针对预处理 LLM 集成虚拟助手的显著攻击的检测与防御

密码学与安全 2024-01-03 v1

摘要

集成大语言模型(LLM)的虚拟助手的出现带来了通信动态的快速转变。在虚拟助手开发过程中,一些开发者倾向于利用系统消息(也称为初始提示或自定义提示)进行预处理。然而,重要的是要认识到,过度依赖此功能会增加被恶意行为者操纵的风险,他们可以利用精心设计的提示来利用它。这种恶意操纵构成了重大威胁,可能会损害虚拟助手响应的准确性和可靠性。因此,利用检测和防御机制保护虚拟助手对于确保其安全性和完整性至关重要。在本研究中,我们探讨了三种旨在针对系统消息攻击的检测和防御机制。这些机制包括插入参考密钥、利用 LLM 评估器以及实施自我提醒(Self-Reminder)。为了展示这些机制的有效性,我们针对显著的攻击技术进行了测试。我们的研究结果表明,所调查的机制能够准确识别并 counteract 这些攻击。这些机制的有效性强调了它们在保护虚拟助手完整性和可靠性方面的潜力,加强了其在现实场景中实施的重要性。通过优先考虑虚拟助手的安全性,组织可以维持用户信任,保持应用的完整性,并在这个变革性技术时代 uphold 预期的高标准。

关键词

引用

@article{arxiv.2401.00994,
  title  = {Detection and Defense Against Prominent Attacks on Preconditioned LLM-Integrated Virtual Assistants},
  author = {Chun Fai Chan and Daniel Wankit Yip and Aysan Esmradi},
  journal= {arXiv preprint arXiv:2401.00994},
  year   = {2024}
}

备注

Accepted to be published in the Proceedings of the 10th IEEE CSDE 2023, the Asia-Pacific Conference on Computer Science and Data Engineering 2023