SEAHateCheck:面向东南亚低资源语言的仪表盘式仇恨言论检测
计算与语言
2026-03-18 v1 人工智能
摘要
仇恨言论检测高度依赖语言资源,而这些资源主要在英语和中文等高资源语言中可用,导致研究人员和平台在开发针对东南亚低资源语言的工具时面临障碍。东南亚地区语言环境多样化,使在线仇恨内容的 moderation 变得尤为复杂。为此,我们引入 SEAHateCheck,一个专为印度尼西亚、泰国、菲律宾和越南量身定制的数据集,覆盖印尼语、塔加洛语、泰语和越南语。基于 HateCheck 的功能测试框架和改进 SGHateCheck 方法,SEAHateCheck 提供符合文化背景的测试用例,辅以大型语言模型生成,并由当地专家验证准确性。使用最先进的模型和多语言模型进行实验,结果显示在检测这些低资源语言的仇恨言论时存在局限。特别是,塔加洛语的测试用例准确率最低,可能源于语言的复杂性和训练数据的有限性。相比之下,基于俚语的功能测试最为困难,因为模型在处理带有文化细节的表达时表现不佳。SEAHateCheck 的诊断性洞察进一步暴露了模型在隐式仇恨检测和对反仇恨表达处理方面的弱点。作为这些东南亚语言首个功能测试套件,本工作为研究人员提供了稳健的基准,推动开发适用于包容性在线内容 moderation 的实用、符合文化背景的仇恨言论检测工具。
引用
@article{arxiv.2603.16070,
title = {SEAHateCheck: Functional Tests for Detecting Hate Speech in Low-Resource Languages of Southeast Asia},
author = {Ri Chi Ng and Aditi Kumaresan and Yujia Hu and Roy Ka-Wei Lee},
journal= {arXiv preprint arXiv:2603.16070},
year = {2026}
}
备注
TALLIP Accepted