突破 Tulu 低资源障碍:针对仇恨语言识别的神经模型与语料库构建
计算与语言
2025-08-18 v1
摘要
Tulu 是一种在印度南部主要使用的低资源达利语,尽管数字化存在增长,但计算资源有限。本研究为 Tulu 社交媒体内容中的仇恨语言识别(OLI)构建首个基准数据集,数据来源于 YouTube 评论,覆盖多个领域。该数据集经高可靠性注释(Krippendorff's alpha = 0.984),包含 3,845 条评论,分为四类:非仇恨、非 Tulu、非针对性仇恨、针对性仇恨。我们评估了包括 GRU、LSTM、BiGRU、BiLSTM、CNN 和注意力变体等深度学习模型,以及变换器架构(mBERT、XLM-RoBERTa)。以 BiGRU 加自注意力模型 achieving 最佳性能,准确率达82%,宏F1分数达0.81。变换器模型表现不佳,凸显了在代码混合、资源有限情境下多语言预训练的局限性。本工作为 Tulu 及类似低资源、代码混合语言的进一步 NLP 研究奠定了基础。
引用
@article{arxiv.2508.11166,
title = {Overcoming Low-Resource Barriers in Tulu: Neural Models and Corpus Creation for OffensiveLanguage Identification},
author = {Anusha M D and Deepthi Vikram and Bharathi Raja Chakravarthi and Parameshwar R Hegde},
journal= {arXiv preprint arXiv:2508.11166},
year = {2025}
}
备注
20 pages, 3 tables, 3 figures. Submitted to Language Resources and Evaluation (Springer)