波斯语用户生成文本内容的挑战:一种基于机器学习的方法
计算与语言
2021-01-21 v1
摘要
近年来,大量研究论文与著作致力于开发有效方法,以利用海量用户生成内容并构建其上的智能预测模型。本研究应用基于机器学习的方法应对波斯语用户生成文本内容所带来的障碍。遗憾的是,在利用机器学习方法对波斯语文本进行分类/聚类方面研究仍显不足。此外,波斯语文本分析受限于资源匮乏,尤其是数据集与文本处理工具。由于波斯语的句法与语义不同于英语及其他语言,这些语言的现有资源无法立即用于波斯语。另外,波斯语的名词与代词识别、词性标注、词边界确定、词干提取或字符处理仍是未解决问题,需进一步研究。因此,本研究作出努力以应对部分挑战。所提方法使用机器翻译数据集对波斯语进行情感分析。最后,该数据集经不同分类器与特征工程方法演练。实验结果显示出相较于以往工作的 promising 的最优性能;最佳分类器为支持向量机,其精确率 91.22%、召回率 91.71%、F1 分数 91.46%。
引用
@article{arxiv.2101.08087,
title = {The Challenges of Persian User-generated Textual Content: A Machine Learning-Based Approach},
author = {Mohammad Kasra Habib},
journal= {arXiv preprint arXiv:2101.08087},
year = {2021}
}
备注
12 Pages bib inc., 5 Figures and 5 Tables