ThaiSafetyBench:评估泰语文化背景下语言模型安全性
摘要
大型语言模型 (LLM) 的安全评估主要聚焦于英语,留下了非英语语言和文化特定风险的探索不足。本文聚焦泰语语言和文化背景下的 LLM 安全性,介绍了 ThaiSafetyBench——一个包含 1,954 个泰语恶意提示的数据集。该数据集涵盖一般有害提示以及显式基于泰语文化、社会和语境细节的攻击。使用 ThaiSafetyBench,我们评估了 24 个语言模型,其中 GPT-4.1 和 Gemini-2.5-Pro 作为 LLM 评判器。结果显示,闭源模型总体上表现出更强的安全性能,这引发了对公开可用模型鲁健性的重要关切。此外,我们观察到针对泰语特定、文化语境化攻击的攻击成功率 (ASR) 明显高于一般泰语攻击,这凸显了当前安全对齐方法的关键漏洞。为提高可重复性和计算效率,我们进一步微调了一个基于 DeBERTa 的有害响应分类器,命名为 ThaiSafetyClassifier。该模型在加权 F1 分数上达到 84.4%,与 GPT-4.1 的判断相匹配。我们公开发布微调权重和训练脚本以支持可重复性。最后,我们引入 ThaiSafetyBench 排行榜,以持续更新安全评估并鼓励社区参与。- ThaiSafetyBench HuggingFace 数据集:https://huggingface.co/datasets/typhoon-ai/ThaiSafetyBench - ThaiSafetyBench Github:https://github.com/trapoom555/ThaiSafetyBench - ThaiSafetyClassifier HuggingFace 模型:https://huggingface.co/typhoon-ai/ThaiSafetyClassifier - ThaiSafetyBench 排行榜:https://huggingface.co/spaces/typhoon-ai/ThaiSafetyBench-Leaderboard
引用
@article{arxiv.2603.04992,
title = {ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts},
author = {Trapoom Ukarapol and Nut Chukamphaeng and Kunat Pipatanakul and Pakhapoom Sarapat},
journal= {arXiv preprint arXiv:2603.04992},
year = {2026}
}
备注
ICLR 2026 Workshop on Principled Design for Trustworthy AI