波斯语文本言语行为分类器及其在谣言识别中的应用
计算与语言
2020-07-14 v4 机器学习
机器学习
摘要
言语行为(SA)是语用学的重要领域之一,它使我们更好地理解人们的心态并传达预期的语言功能。对文本SA的了解有助于在自然语言处理应用中分析该文本。本研究提出一种基于词典的波斯语SA识别统计技术。所提技术依据词汇、句法、语义和表层特征四项准则将文本分类为七类SA。利用WordNet作为提取同义词和丰富特征词典的工具。为评估所提技术,我们采用了四种分类方法,包括随机森林(RF)、支持向量机(SVM)、朴素贝叶斯(NB)和K近邻(KNN)。实验结果表明,所提方法使用RF和SVM作为最佳分类器,在波斯语SA分类上以0.95的准确率达到了最先进性能。我们此项工作的初衷是引入SA识别在社交媒体内容上的应用,尤其是谣言中的常见SA。因此,所提系统被用于确定谣言中的常见SA。结果表明,波斯语谣言常表达于三类SA中,包括叙述、疑问和威胁,在某些情况下伴随请求SA。
引用
@article{arxiv.1901.03904,
title = {A Speech Act Classifier for Persian Texts and its Application in Identifying Rumors},
author = {Zoleikha Jahanbakhsh-Nagadeh and Mohammad-Reza Feizi-Derakhshi and Arash Sharifi},
journal= {arXiv preprint arXiv:1901.03904},
year = {2020}
}
备注
Published Link: http://jscit.nit.ac.ir/article_103557.html