中文

探索直白的对话红队测试

计算与语言 2024-09-10 v1 人工智能

摘要

大型语言模型(LLMs)日益被用于商业对话系统,但它们存在安全和伦理风险。多轮对话(multi-turn conversations)是一种上下文影响模型行为的方式,可被用于产生不希望的响应。在本文中,我们检验了利用现成 LLM 在直白的红队测试方法中的有效性,其中攻击 LLM 旨在从目标 LLM 诱导产生不希望的输出,比较了单轮和对话式红队测试策略。我们的实验提供了各种用法策略的见解,这些策略显著影响其作为红队者的效果。它们表明,现成模型可作为有效的红队者,即使会根据过去的尝试调整其攻击策略,尽管其效果随对齐程度的增加而减弱。

关键词

引用

@article{arxiv.2409.04822,
  title  = {Exploring Straightforward Conversational Red-Teaming},
  author = {George Kour and Naama Zwerdling and Marcel Zalmanovici and Ateret Anaby-Tavor and Ora Nova Fandina and Eitan Farchi},
  journal= {arXiv preprint arXiv:2409.04822},
  year   = {2024}
}