中文

乌尔杜语讽刺检测:基于机器学习模型和大型语言模型的比较研究

计算与语言 2025-10-28 v1

摘要

讽刺识别是自然语言处理中的一个具有挑战性的任务,尤其是当处理语法和文化背景不同的语言时。本文旨在通过将英文讽刺语料库翻译成乌尔杜语来检测乌尔杜语中的讽刺。我们使用 GloVe 和 Word2Vec 嵌入评估十个最先进的机器学习算法,并将其性能与经典方法进行比较。此外,我们对先进的基于变换器的模型(包括 BERT、RoBERTa、LLaMA 2 (7B)、LLaMA 3 (8B) 和 Mistral)进行微调,以评估大规模模型在讽刺检测中的效果。其中,机器学习模型中 Gradient Boosting 以 89.18% 的 F1 分数取得最佳性能;变换器模型中 LLaMA 3 (8B) 以 94.61% 的 F1 分数取得最高性能。这些结果表明,结合 transliteration 技术与现代 NLP 模型能够在乌尔杜语这种历史性的低资源语言上实现可靠的讽刺检测。

关键词

引用

@article{arxiv.2510.22356,
  title  = {Irony Detection in Urdu Text: A Comparative Study Using Machine Learning Models and Large Language Models},
  author = {Fiaz Ahmad and Nisar Hussain and Amna Qasim and Momina Hafeez and Muhammad Usman Grigori Sidorov and Alexander Gelbukh},
  journal= {arXiv preprint arXiv:2510.22356},
  year   = {2025}
}

备注

5 pages, 3 figuers