KZ-SafetyPrompts:面向大语言模型的哈萨克斯afety评估提示数据集
计算与语言
2026-05-29 v1
摘要
哈萨克语在大语言模型安全行为评估资源中存在代表性不足。我们提出 KZ-SafetyPrompts,一个覆盖十一个类别的哈萨克语提示数据集,涵盖自伤、暴力、儿童虐待、性内容、种族主义内容、极端主义、受监管商品或非法活动等常见风险领域。该数据集包含 5,717 条以哈萨克语(西里尔字母)书写的提示语,按类别组织,并附有英文翻译以支持跨语言分析。提示语类似现实用户查询,常以青少年或儿童风格表述,呈现为意图提示式,无程序化指令。我们记录了编写协议、标注程序(包括边缘案例决策规则)以及质量控制措施(模式标准化、完整性检查和去重)。我们还将类别与广泛使用的安全分类法对齐,以支持与现有评估管道的集成。GPT-4o 的基线结果显示,总体拒绝率为 28.2%,各类别拒绝率从 5.5% 到 53.8% 不等,表明哈萨克语提示语暴露了非英文评估未捕捉的类别特定安全缺口。
引用
@article{arxiv.2605.26947,
title = {KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models},
author = {Wajdi Zaghouani and Shimaa Amer Ibrahim and Aruzhan Muratbek and Olzhasbek Zhakenov and Adiya Akhmetzhanova},
journal= {arXiv preprint arXiv:2605.26947},
year = {2026}
}
备注
Accepted at the SIGUL2026 Workshop co-located with LREC2026