基于集成本地知识库的社交媒体信息预处理框架
计算与语言
2020-07-08 v1
摘要
以往大多数关于社交媒体信息语义分析的研究都未考虑嵌入在社交媒体帖子中的俚语、缩写和首字母缩略词所带来的歧义问题。这些含噪术语具有隐含意义,并构成丰富语义上下文的一部分,必须对其加以分析才能从社交媒体信息中获得完整洞察。本文提出了一种改进的社交媒体信息预处理框架以提升性能。为此,我们将由本地知识源(Naijalingo)、城市词典和网络俚语组成的集成知识库(ikb)与改进的 Lesk 算法相结合,以促进社交媒体信息的语义分析。实验结果表明,当在支持向量机、多层感知机和卷积神经网络这三种机器学习模型上进行测试时,所提方法的性能优于现有方法。该框架在标准化数据集上的准确率为 94.07%,在用于从推文中提取情感时的本地化数据集上准确率为 99.78%。在本地化数据集上提升的性能揭示了将本地知识源的使用集成到社交媒体信息分析过程中的优势,特别是在解释具有语境根源意义的俚语/首字母缩略词/缩写方面。
引用
@article{arxiv.2006.15854,
title = {A Framework for Pre-processing of Social Media Feeds based on Integrated Local Knowledge Base},
author = {Taiwo Kolajo and Olawande Daramola and Ayodele Adebiyi and Seth Aaditeshwar},
journal= {arXiv preprint arXiv:2006.15854},
year = {2020}
}
备注
38 pages, 5 figures, 6 tables