CSSBench:评估轻量级LLM针对中文特定对抗模式的安全性
计算与语言
2026-01-06 v2
摘要
大型语言模型(LLM)日益部署在成本敏感和本地设备场景中,安全防护主要在英语方面取得了进展。然而,真实世界的中文恶意查询通常通过同音字、拼音、基于符号的分割等中文特定模式来隐藏意图。这些中文特定的对抗模式导致现有以英语为中心的基准测试无法充分捕捉到的安全评估鸿沟。这一鸿沟在轻量级模型方面尤为棘手,因为这些模型可能更容易受到此类特定对抗扰动的攻击。为弥合这一鸿沟,我们引入了强调这些对抗模式的中文特定安全基准(Chinese-Specific Safety Benchmark, CSSBench),用于评估轻量级LLM在中文场景下的安全性。我们的基准涵盖六个常见的中文场景领域,包括违法活动和合规、隐私泄露、健康和医疗误导信息、欺诈和仇恨、成人内容以及公共和政治安全,并将查询组织为多种任务类型。我们评估了一组流行的轻量级LLM,并衡量过度拒绝行为以评估安全性导致的性能下降。我们的结果表明,中文特定的对抗模式是轻量级LLM的一个关键挑战。该基准为LLM在中文中的安全性提供了全面评估,助力实际部署中实现稳健性。
引用
@article{arxiv.2601.00588,
title = {CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns},
author = {Zhenhong Zhou and Shilinlu Yan and Chuanpu Liu and Qiankun Li and Kun Wang and Zhigang Zeng},
journal= {arXiv preprint arXiv:2601.00588},
year = {2026}
}
备注
18 pages