PerSoMed: 一个大规模平衡的波斯语社交媒体文本分类数据集
计算与语言
2026-05-26 v2 信息检索
社会与信息网络
摘要
本研究引入了第一个大规模、良好平衡的波斯语社交媒体文本分类数据集,专门旨在解决该领域缺乏全面资源的问题。该数据集包含跨越九个类别(经济、艺术、体育、政治、社会、健康、心理、历史以及科学与技术)的36,000条帖子,每个类别包含4,000个样本以确保类别分布平衡。数据收集涉及来自各种波斯语社交媒体平台的60,000条原始帖子,随后进行了严格的预处理和结合了基于ChatGPT的少样本提示与人工验证的混合标注。为了缓解类别不平衡,我们采用了带有语义冗余移除的欠采样以及结合了词汇替换和生成式提示的高级数据增强策略。我们对多个模型进行了基准测试,包括BiLSTM、XLM-RoBERTa(采用LoRA和AdaLoRA适配)、FaBERT、基于SBERT的架构以及波斯语专用的TookaBERT(Base和Large)。实验结果表明,基于Transformer的模型始终优于传统神经网络,其中TookaBERT-Large取得了最佳性能(精确率: 0.9622, 召回率: 0.9621, F1分数: 0.9621)。逐类别评估进一步证实了所有类别上的稳健性能,尽管由于固有的模糊性,社会和政治文本的得分略低。本研究提供了一个新的高质量数据集,并对前沿模型进行了全面评估,为波斯语自然语言处理的进一步发展(包括趋势分析、社会行为建模和用户分类)奠定了坚实基础。该数据集已公开,以支持未来的研究工作。
引用
@article{arxiv.2602.19333,
title = {PerSoMed: A Large-Scale Balanced Dataset for Persian Social Media Text Classification},
author = {Isun Chehreh and Ebrahim Ansari},
journal= {arXiv preprint arXiv:2602.19333},
year = {2026}
}
备注
10 pages, including 1 figure