中文

探索波斯语中的主观任务:调查分析与语言模型评估

计算与语言 2025-09-09 v1

摘要

鉴于波斯语拥有超过1.27亿名说话者,且数字文本资源日益丰富(包括超过130万篇维基百科文章),其被视为中等资源语言。然而, upon 更深入的审视,这一标签很快便显露出问题。我们聚焦于三项主观任务(情感分析、情绪分析与毒性检测),发现尽管数据总体量的增加,数据可得性与质量仍面临重大挑战。我们审阅了关于波斯语主观任务的110篇文献,发现公开数据集严重不足。此外,现有数据集常缺乏关键人口学因素(如年龄和性别),这些因素对于准确建模语言中的主观性至关重要。在使用少数可用数据集进行模型评估时,结果在数据集和模型之间高度不稳定。我们的发现表明,数据量本身并不足以显著提升语言在NLP领域的前景。

关键词

引用

@article{arxiv.2509.05719,
  title  = {Exploring Subjective Tasks in Farsi: A Survey Analysis and Evaluation of Language Models},
  author = {Donya Rooein and Flor Miriam Plaza-del-Arco and Debora Nozza and Dirk Hovy},
  journal= {arXiv preprint arXiv:2509.05719},
  year   = {2025}
}