泰卢固语-英语语码混合仇恨言论检测
计算与语言
2025-02-18 v1
摘要
在泰卢固语等低资源语言中进行仇恨言论检测是自然语言处理(NLP)领域日益增长的挑战。本研究调查了基于 Transformer 的模型,包括 TeluguHateBERT、HateBERT、DeBERTa、Muril、IndicBERT、Roberta 和 Hindi-Abusive-MuRIL,用于泰卢固语仇恨言论分类。我们使用低秩适应对模型进行微调,以优化效率和性能。此外,我们探索了一种多语言方法,使用 Google Translate 将泰卢固语文本翻译成英语,以评估其对分类准确率的影响。我们的实验表明,大多数模型在翻译后表现出性能提升,与直接在泰卢固语文本上训练相比,DeBERTa 和 Hindi-Abusive-MuRIL 获得了更高的准确率和 F1 分数。值得注意的是,Hindi-Abusive-MuRIL 在原始泰卢固语数据集和翻译后的数据集中均优于所有其他模型,证明了其在不同语言环境下的鲁棒性。这表明翻译使模型能够利用英语中更丰富的语言特征,从而提高分类性能。结果表明,多语言处理可以成为低资源语言仇恨言论检测的有效方法。这些发现证明,经过适当微调的 Transformer 模型可以显著改善泰卢固语的仇恨言论检测,为更鲁棒的多语言 NLP 应用铺平道路。
引用
@article{arxiv.2502.10632,
title = {Code-Mixed Telugu-English Hate Speech Detection},
author = {Santhosh Kakarla and Gautama Shastry Bulusu Venkata},
journal= {arXiv preprint arXiv:2502.10632},
year = {2025}
}
备注
4 pages, 1 figure, 2 tables