中文

基于异构信息网络的比较文本互聚类

信息检索 2019-03-12 v1 计算与语言

摘要

当前,许多情报系统包含来自多源的文本,例如电子公告板系统(BBS)帖子、推文和新闻。这些文本可能是“比较性”的,因为它们在语义上相关,从而为我们提供针对同一主题或事件的不同视角。为了更好地组织多源文本并获得更全面的知识,我们提出研究比较文本互聚类(MCCT)这一新问题,其旨在同时且协作地对比较文本进行聚类。MCCT 问题难以解决,因为 1)比较文本通常呈现不同的数据格式与结构,因而难以组织;2)缺乏有效的方法连接语义相关的比较文本以统一方式促进其聚类。为此,本文提出基于异构信息网络的文本聚类框架 HINT。HINT 首先通过引入共享的“锚文本”连接比较文本,将多源文本(如新闻与推文)建模为异构信息网络。接着,基于 HINT 构建两个相似度矩阵以及用于跨文本源知识转移的转移矩阵。然后利用所构建的矩阵进行比较文本聚类。最后,还提出一种互聚类算法,通过引入聚类一致性约束进一步统一比较文本各自的聚类结果。我们在三个推文-新闻数据集上进行了充分实验,结果证明了所提方法在解决 MCCT 问题上的有效性与鲁棒性。

关键词

引用

@article{arxiv.1903.03762,
  title  = {Mutual Clustering on Comparative Texts via Heterogeneous Information Networks},
  author = {Jianping Cao and Senzhang Wang and Danyan Wen and Zhaohui Peng and Philip S. Yu and Fei-yue Wang},
  journal= {arXiv preprint arXiv:1903.03762},
  year   = {2019}
}