TeleAI-Safety:面向攻击、防御与评估的全方位 LLM 恶作剧基准
密码学与安全
2025-12-09 v2
摘要
尽管大型语言模型 (LLM) 在高价值行业的部署持续扩张,但对其安全性进行系统性评估以应对恶作剧和基于提示的攻击仍不足。现有的安全评估基准和框架常受限于核心组件(攻击、防御和评估方法)之间的不平衡集成,以及灵活评估框架与标准化基准能力之间的孤立。这导致可靠的跨研究比较受阻,并为全面风险评估创造不必要的开销。为解决这些问题,我们提出了 TeleAI-Safety,一个模块化且可重复的框架,配合系统化基准,用于严格的 LLM 安全评估。我们的框架集成了广泛的 19 种攻击方法(包括一种自主开发的方法)、29 种防御方法以及 19 种评估方法(包括一种自主开发的方法)。该基准包含 342 个样本,涵盖 12 个不同风险类别,对 14 个目标模型进行了广泛评估。结果揭示了系统性漏洞和模型特定的失效案例,突显了安全性与实用性之间的关键权衡,并确定了未来优化的潜在防御模式。在实际场景中,TeleAI-Safety 可以通过自定义攻击、防御和评估组合的灵活调整,以满足特定需求。我们发布了完整的代码和评估结果,以促进可重复研究并建立统一的安全基准。
引用
@article{arxiv.2512.05485,
title = {TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations},
author = {Xiuyuan Chen and Jian Zhao and Yuxiang He and Yuan Xun and Xinwei Liu and Yanshu Li and Huilin Zhou and Wei Cai and Ziyan Shi and Yuchen Yuan and Tianle Zhang and Chi Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2512.05485},
year = {2025}
}