GHaLIB:用于低资源语言希望言检测的多语言框架
计算与语言
2026-03-17 v1 人工智能
机器学习
摘要
希望言(hope speech)在自然语言处理(NLP)中相对缺乏关注。当前的研究主要聚焦于英文,导致面向低资源语言(如乌尔都语)的工具创建受限。尽管基于Transformer的架构在检测仇恨和冒犯性言论方面表现出色,但针对希望言或更广泛地测试这些模型在各种语言环境中的表现的工作仍很少。本文提出了一个面向希望言检测的多语言框架,重点关注乌尔都语。使用预训练的Transformer模型(如 XLM-RoBERTa、mBERT、EuroBERT 和 UrduBERT),我们应用简单的预处理并训练分类器以获得更好的结果。在 PolyHope-M 2025 基准测试上的评估显示,乌尔都语二分类的 F1 分数可达 95.2%,乌尔都语多分类的 F1 分数为 65.2%,在西班牙语、德语和英文方面也取得了类似的竞争成绩。这些结果凸显了在低资源环境中实现现有多语言模型的可能性,从而更容易识别希望言,帮助构建更具建设性的数字话语。
引用
@article{arxiv.2512.22705,
title = {GHaLIB: A Multilingual Framework for Hope Speech Detection in Low-Resource Languages},
author = {Ahmed Abdullah and Sana Fatima and Haroon Mahmood},
journal= {arXiv preprint arXiv:2512.22705},
year = {2026}
}
备注
Accepted and presented at the 15th International Arab Conference on Information Technology (ICAIT); proceedings not yet published