区分事实与虚构:基于复杂网络的文本模式识别
计算与语言
2010-10-15 v2 统计力学
物理与社会
摘要
我们建立了具体的数学判据来区分不同类型的书面叙事,即虚构与非虚构。具体而言,我们从小说和新闻故事中构建了语义网络,以个独立单词作为顶点或节点,并将出现在给定顶点个位置内的单词分配为边或链接;我们称为词距。然后,我们使用复杂网络理论的度量来区分新闻和小说,研究了所需的最小文本长度以及优化的词距。发现文献样本通过其度分布和聚类系数的相应幂律最能有效表示;我们还研究了平均测地距离,并发现所有文本都是小世界网络。我们观察到在处存在一个自然断点,度分布的幂律在此处发生变化,从而对的主体和尾部进行独立的幂律拟合。我们的线性判别分析对小说的正确分类准确率为,对新闻故事的准确率为。我们找到了最优词距和最小文本长度100到200个单词。
引用
@article{arxiv.1007.3254,
title = {Distinguishing Fact from Fiction: Pattern Recognition in Texts Using Complex Networks},
author = {J. T. Stevanak and David M. Larue and Lincoln D. Carr},
journal= {arXiv preprint arXiv:1007.3254},
year = {2010}
}
备注
9 pages, 7 figures -- this is a significant revision