中文

在多轮多智能体博弈中演化多样化的红队语言模型

计算与语言 2024-07-30 v5 计算机科学与博弈论

摘要

部署大语言模型(LLM)的主要挑战是确保其无害性。红队可以通过攻击 LLM 来识别漏洞以获得安全性。然而,当前的努力严重依赖单轮提示设计以及针对固定蓝队的单边红队优化。这些静态方法导致生成多样性显著下降,即所谓的模式崩溃,这使得在日益复杂的人-LLM 交互中难以发现潜在风险。在此我们引入动态红队博弈(RTG)来全面分析红队与蓝队之间的多轮攻防交互。此外,我们开发了带有多样性度量的游戏化红队求解器(GRTS)以缓解模式崩溃,并从理论上保证近似纳什均衡的收敛,从而为双方带来更好的策略。实证结果表明,GRTS 探索多样且隐式的攻击以自适应地利用各种 LLM,超越了特定模式的限制。富有洞见地,我们揭示的红队任务的几何结构与陀螺假设一致,证实了构建多样化 LLM 群体作为异质人类专家红队员之有前景代理的必要性。这为 LLM 的可扩展毒性检测与安全对齐铺平了道路。

关键词

引用

@article{arxiv.2310.00322,
  title  = {Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games},
  author = {Chengdong Ma and Ziran Yang and Hai Ci and Jun Gao and Minquan Gao and Xuehai Pan and Yaodong Yang},
  journal= {arXiv preprint arXiv:2310.00322},
  year   = {2024}
}