中文

波斯语文本言语行为分类器及其在谣言识别中的应用

计算与语言 2020-07-14 v4 机器学习 机器学习

摘要

言语行为(SA)是语用学的重要领域之一,它使我们更好地理解人们的心态并传达预期的语言功能。对文本SA的了解有助于在自然语言处理应用中分析该文本。本研究提出一种基于词典的波斯语SA识别统计技术。所提技术依据词汇、句法、语义和表层特征四项准则将文本分类为七类SA。利用WordNet作为提取同义词和丰富特征词典的工具。为评估所提技术,我们采用了四种分类方法,包括随机森林(RF)、支持向量机(SVM)、朴素贝叶斯(NB)和K近邻(KNN)。实验结果表明,所提方法使用RF和SVM作为最佳分类器,在波斯语SA分类上以0.95的准确率达到了最先进性能。我们此项工作的初衷是引入SA识别在社交媒体内容上的应用,尤其是谣言中的常见SA。因此,所提系统被用于确定谣言中的常见SA。结果表明,波斯语谣言常表达于三类SA中,包括叙述、疑问和威胁,在某些情况下伴随请求SA。

关键词

引用

@article{arxiv.1901.03904,
  title  = {A Speech Act Classifier for Persian Texts and its Application in Identifying Rumors},
  author = {Zoleikha Jahanbakhsh-Nagadeh and Mohammad-Reza Feizi-Derakhshi and Arash Sharifi},
  journal= {arXiv preprint arXiv:1901.03904},
  year   = {2020}
}

备注

Published Link: http://jscit.nit.ac.ir/article_103557.html