基于文本判别建模的霍克斯过程分类
社会与信息网络
2020-10-23 v1
摘要
社交媒体为用户提供了聚集、分享信息以及了解新闻的平台。此类网络也为用户提供了参与对话的平台。然而,诸如 Twitter 这样的微博平台限制了文本长度。由于此类帖子中单词出现频次不足,使用自然语言处理(NLP)的标准工具对这类信息进行分类是一项具有挑战性的任务。此外,社交媒体中帖子高度复杂且动态化,使得文本分类成为一项难题。不过,考虑以帖子过往标签和关联时间形式的额外线索,有可能有助于更好地执行文本分类。为解决该问题,我们提出基于霍克斯过程(HP)的模型,其可自然地将时间特征与过往标签连同文本特征一并纳入,以改进短文本分类。具体而言,我们提出一种在 HP 中建模文本的判别方法,其中文本特征参数化基强度和/或触发核。另一主要贡献是将核视为时间和文本的函数,并进一步使用神经网络对核建模。这使得在推文分类中能够建模并有效学习文本及历史影响。我们在谣言立场分类的标准基准上展示了所提技术的优势。
引用
@article{arxiv.2010.11851,
title = {Hawkes Process Classification through Discriminative Modeling of Text},
author = {Rohan Tondulkar and Manisha Dubey and P. K. Srijith and Michal Lukasik},
journal= {arXiv preprint arXiv:2010.11851},
year = {2020}
}
备注
9 pages, 10 figures