中文

基于事件不确定性的 Twitter 主题上下文向量关联

计算与语言 2023-04-05 v1

摘要

关键词提取是文本挖掘中的关键过程。从 Twitter 数据中提取带有相应上下文事件的关键词是一大挑战。挑战性问题主要源于所用语言的非正式性。错拼词、缩略语和歧义术语的使用导致了非正式性。当前系统对非正式语言的关键词提取基于模式或基于事件。本文利用数据关联,通过主题事件提取上下文关键词。在所提系统中,事件的上下文主题利用不确定性原理进行识别。主题上下文借助称为主题上下文向量的向量进行加权,这些向量将事件标识为确定或不确定。该系统在 Twitter COVID-19 数据集上进行了测试并证明有效。系统从测试数据集中提取特定事件的上下文主题向量并对其进行排序。提取的主题上下文向量用于上下文主题向量的聚类,与现有最优方法即 TF 和 TF-IDF 相比,轮廓系数提高了 0.5%。主题上下文向量可用于其他应用,如网络欺凌、讽刺检测、比喻语言检测等。

关键词

引用

@article{arxiv.2304.01423,
  title  = {Thematic context vector association based on event uncertainty for Twitter},
  author = {Vaibhav Khatavkar and Swapnil Mane and Parag Kulkarni},
  journal= {arXiv preprint arXiv:2304.01423},
  year   = {2023}
}

备注

6 pages