代码切换红队测试:LLM安全与多语言理解的评估
人工智能
2025-06-12 v3 计算与语言
摘要
随着大型语言模型(LLM)的快速发展,围绕其安全性的关注日益突出。本文发现,红队测试查询中的代码切换(code-switching)能够有效诱发 LLM 的不良行为,而这种做法在自然语言中很常见。我们引入了一个简单而有效的框架CSRT,用于综合代码切换红队查询,全面调查 LLM 的安全性和多语言理解能力。通过针对十个最先进 LLM 和包含最多10种语言的代码切换查询进行大量实验,我们证明CSRT在英语常规攻击中实现了46.7%的攻击数量,显著优于现有多语言红队技术,且在传统安全领域同样有效。我们还检查了这些 LLM 生成和理解代码切换文本的多语言能力。此外,我们验证了CSRT的可扩展性,通过单语数据生成代码切换攻击提示。最后,我们进行详细的消融研究,探讨了代码切换问题,并提出了语言资源可获得性与现有多语言 LLM 安全对齐之间意外的相关性。
引用
@article{arxiv.2406.15481,
title = {Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual Understanding},
author = {Haneul Yoo and Yongjin Yang and Hwaran Lee},
journal= {arXiv preprint arXiv:2406.15481},
year = {2025}
}
备注
To appear in ACL 2025