面向东南亚的文化感知多语言安全框架 SEA-Guard
计算与语言
2026-02-03 v1
摘要
在现实场景中,文化感知的安全措施对于 AI 对齐至关重要,安全范围远超常识,涵盖多样化的本土价值观、规范以及区域特定的法规。然而,构建大规模、以文化为基础的数据集具有挑战性,由于资源有限且缺乏本地标注者。因此,许多安全模型依赖英语数据集的机器翻译,常常忽略区域和文化细微差别。我们提出一种新型的代理驱动数据生成框架,以可扩展的方式创建针对东南亚(SEA)的真实、区域特定的安全数据集。基于此,我们引入 SEA-Guard 系列,这是首个以东南亚文化语境为基础的多语言安全模型。经过多个基准测试和文化变体评估,SEA-Guard 在检测区域敏感或有害内容方面始终优于现有安全模型,同时保持强大的通用安全性能。
关键词
引用
@article{arxiv.2602.01618,
title = {SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia},
author = {Panuthep Tasawong and Jian Gang Ngui and Alham Fikri Aji and Trevor Cohn and Peerat Limkonchotiwat},
journal= {arXiv preprint arXiv:2602.01618},
year = {2026}
}
备注
Under reivew