多语言希望言论检测:逻辑回归、mBERT与XLM-RoBERTa结合主动学习的比较研究
计算与语言
2025-09-25 v1 机器学习
摘要
促进鼓励和乐观的希望言论语言在推动在线积极话语方面发挥着重要作用。然而,其检测仍然具有挑战性,尤其是在多语言和低资源环境中。本文提出了一种基于主动学习方法和基于Transformer的模型(包括mBERT和XLM-RoBERTa)的多语言希望言论检测框架。在英语、西班牙语、德语和乌尔都语的数据集上进行了实验,包括近期共享任务的基准测试集。结果表明,Transformer模型显著优于传统基线,XLM-RoBERTa取得了最高的整体准确率。此外,我们的主动学习策略即使在少量标注数据集上也能保持强劲性能。本研究强调了将多语言Transformer与数据高效训练策略相结合用于希望言论检测的有效性。
引用
@article{arxiv.2509.20315,
title = {Multilingual Hope Speech Detection: A Comparative Study of Logistic Regression, mBERT, and XLM-RoBERTa with Active Learning},
author = {T. O. Abiola and K. D. Abiodun and O. E. Olumide and O. O. Adebanji and O. Hiram Calvo and Grigori Sidorov},
journal= {arXiv preprint arXiv:2509.20315},
year = {2025}
}