IndoSafety:印度尼西亚语言中大语言模型的文化植根安全性
计算与语言
2025-06-04 v1
摘要
尽管特定区域的大型语言模型(LLM)日益增多,但其安全性仍未被充分探索,特别是在印度尼西亚等文化多元的环境中,对当地规范的敏感性至关重要且备受社区重视。在本工作中,我们提出了 IndoSafety,这是首个专为印度尼西亚语境定制的高质量、人工验证的安全评估数据集,涵盖五种语言变体:正式和口语印尼语,以及三种主要当地语言:爪哇语、巽他语和米南加保语。IndoSafety 是通过扩展现有的安全框架来构建一个捕捉印度尼西亚社会文化背景的分类体系而构建的。我们发现,现有的以印尼为中心的 LLM 经常生成不安全的输出,特别是在口语和当地语言环境中,而在 IndoSafety 上进行微调可显著提高安全性,同时保持任务性能。我们的工作强调了对文化植根的安全性评估的迫切需求,并为在多语言环境中负责任地部署 LLM 提供了具体步骤。警告:本文包含可能具有冒犯性、有害性或偏见性的示例数据。
引用
@article{arxiv.2506.02573,
title = {IndoSafety: Culturally Grounded Safety for LLMs in Indonesian Languages},
author = {Muhammad Falensi Azmi and Muhammad Dehan Al Kautsar and Alfan Farizki Wicaksono and Fajri Koto},
journal= {arXiv preprint arXiv:2506.02573},
year = {2025}
}
备注
25 pages