Exa-PSD:面向Twitter的波斯情感分析新数据集
计算与语言
2026-02-25 v1
摘要
如今,社交网络如Twitter是人们最广泛使用的沟通平台。对这些数据的分析具有识别人们在推文中意见的有用信息。情感分析在自然语言处理中发挥着关键作用,识别个体关于特定主题的意见。尽管强大语言模型的出现,波斯语的自然语言处理仍面临诸多挑战。已有的波斯语数据集通常局限于特定主题,如产品、食物、酒店等,而用户在社交媒体上可能使用讽刺、口语化表达。为克服这些挑战,亟需一个波斯语情感分析Twitter数据集。本文介绍了Exa情感分析波斯语数据集,从波斯推文中收集。该数据集包含12,000条推文,由5名波斯语母语标注员标注。数据按积极、中性、消极三个类别进行分类。我们呈现该数据集的特征与统计,并使用预训练的ParsBert和Roberta作为基准模型进行评估。我们的评估达到了79.87%的宏平均F分数,表明该模型和数据对情感分析系统具有相当的价值。
引用
@article{arxiv.2602.20892,
title = {Exa-PSD: a new Persian sentiment analysis dataset on Twitter},
author = {Seyed Himan Ghaderi and Saeed Sarbazi Azad and Mohammad Mehdi Jaziriyan and Ahmad Akbari},
journal= {arXiv preprint arXiv:2602.20892},
year = {2026}
}
备注
This is the original submitted (preprint) version of a paper published in Language Resources and Evaluation. The final published version is available at Springer via DOI: https://doi.org/10.1007/s10579-025-09886-5