TWGuard:针对局部语言语境的 LLM 安全护栏案例研究
密码学与安全
2026-04-21 v1 计算与语言
摘要
安全护栏已成为 AI 安全领域的活跃研究方向,旨在确保大型语言模型(LLM)的适当行为。然而,现有研究缺乏对语言和文化语境差异的考虑,导致报告的性能与实际部署中的效果之间存在差距。为此,本文提出一种针对特定语言语境优化护栏模型的方案,利用针对当地语言特征量身定制的数据集,针对台湾语言语境作为局部部署挑战的典型示例进行优化。该方法产生的 TWGuard 一种语言语境优化后的护栏模型,较基础模型提升了 0.289 的 F1 分值,在实际使用中显著优于最强的基线(误报率降低 0.037,降低了 94.9%)。该工作为地区社区在自身语言语境下建立 AI 安全标准奠定了基础,而无需接受由主导语言施加的边界。我们的结果重新确认了后者的不足。
引用
@article{arxiv.2604.16542,
title = {TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts},
author = {Hua-Rong Chu and Kuan-Chun Wang and Yao-Te Huang},
journal= {arXiv preprint arXiv:2604.16542},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication