探索波斯语中的主观任务:调查分析与语言模型评估
计算与语言
2025-09-09 v1
摘要
鉴于波斯语拥有超过1.27亿名说话者,且数字文本资源日益丰富(包括超过130万篇维基百科文章),其被视为中等资源语言。然而, upon 更深入的审视,这一标签很快便显露出问题。我们聚焦于三项主观任务(情感分析、情绪分析与毒性检测),发现尽管数据总体量的增加,数据可得性与质量仍面临重大挑战。我们审阅了关于波斯语主观任务的110篇文献,发现公开数据集严重不足。此外,现有数据集常缺乏关键人口学因素(如年龄和性别),这些因素对于准确建模语言中的主观性至关重要。在使用少数可用数据集进行模型评估时,结果在数据集和模型之间高度不稳定。我们的发现表明,数据量本身并不足以显著提升语言在NLP领域的前景。
引用
@article{arxiv.2509.05719,
title = {Exploring Subjective Tasks in Farsi: A Survey Analysis and Evaluation of Language Models},
author = {Donya Rooein and Flor Miriam Plaza-del-Arco and Debora Nozza and Dirk Hovy},
journal= {arXiv preprint arXiv:2509.05719},
year = {2025}
}