中文

区分事实与虚构:基于复杂网络的文本模式识别

计算与语言 2010-10-15 v2 统计力学 物理与社会

摘要

我们建立了具体的数学判据来区分不同类型的书面叙事,即虚构与非虚构。具体而言,我们从小说和新闻故事中构建了语义网络,以NN个独立单词作为顶点或节点,并将出现在给定顶点mm个位置内的单词分配为边或链接;我们称mm为词距。然后,我们使用复杂网络理论的度量来区分新闻和小说,研究了所需的最小文本长度以及优化的词距mm。发现文献样本通过其度分布P(k)P(k)和聚类系数C(k)C(k)的相应幂律最能有效表示;我们还研究了平均测地距离,并发现所有文本都是小世界网络。我们观察到在k=Nk=\sqrt{N}处存在一个自然断点,度分布的幂律在此处发生变化,从而对P(k)P(k)的主体和尾部进行独立的幂律拟合。我们的线性判别分析对小说的正确分类准确率为73.8±5.15%73.8 \pm 5.15\%,对新闻故事的准确率为69.1±1.22%69.1 \pm 1.22\%。我们找到了最优词距m=4m=4和最小文本长度100到200个单词NN

关键词

引用

@article{arxiv.1007.3254,
  title  = {Distinguishing Fact from Fiction: Pattern Recognition in Texts Using Complex Networks},
  author = {J. T. Stevanak and David M. Larue and Lincoln D. Carr},
  journal= {arXiv preprint arXiv:1007.3254},
  year   = {2010}
}

备注

9 pages, 7 figures -- this is a significant revision