中文

超越英语与规避:面向高风险中文 LLM 安全评估的人类标注多域基准

计算与语言 2026-05-29 v1

摘要

当大型语言模型 (LLM) 在中文场景中部署时,出现一组问题:在英语中表现良好的安全系统在此情境下会崩溃。这些系统在跨越语言和文化边界方面困难重重,使模型暴露于利用中文特定规避技术(包括拼音罗马化、字符分解、网络俚语和迂回语气)的对抗性提示。为解决这一差距,我们引入 ChiSafe-PAS (Chinese Safety Pilot Annotation Set),这是一套人类标注的、覆盖四个高风险领域(自伤与暴力、毒品与非法贸易、欺诈与讽刺)的、包含 1,897 条对抗性中文提示的基准数据集。其中 1,544 条条目附带完整的黄金标准标注:包括 3 类响应标签 (REFUSE, SAFE-REDIRECT, RESPOND)、九类混淆词汇分类、风险等级评分以及标注者依据。在本文中,我们详细描述数据集设计、标注流程以及混淆词汇分类。我们的首要目标是实用性:为研究社区提供一套高质量、在文化层面上有依据的资源,用于基准测试 LLM 安全对齐。在此过程中,我们参与了该领域的三个更广泛的张力:训练数据与评估数据之间的界限模糊化、基于真实风险的领域覆盖需求,以及规模是否可以替代文化专业知识的限制。

关键词

引用

@article{arxiv.2605.29667,
  title  = {Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese},
  author = {Wajdi Zaghouani and Kholoud K. Aldous and Yicheng Gao},
  journal= {arXiv preprint arXiv:2605.29667},
  year   = {2026}
}