中文

基于词共现网络动力学的文本作者识别

计算与语言 2017-01-30 v1

摘要

争议文档中的作者识别仍需要人类专业知识,但由于实际应用中文本和作者数量庞大,这对许多任务已不可行。在本研究中,我们引入一种基于代表书面文本的词共现网络动力学的方法,对 8 位作者的 80 篇文本语料库进行分类。文本被划分为具有相等语言标记数的段落,从中为 12 个拓扑度量创建时间序列。这些序列被证明是平稳的(p值>0.05),从而允许使用分布矩作为学习属性。通过采用径向基函数网络(Radial Basis Function Network)的优化监督学习过程,80 篇文本中有 68 篇被正确分类,即显著的 85% 作者匹配成功率。因此,发现纯动态网络度量的波动可刻画作者身份,从而为以小型演化网络描述文本开辟了道路。此外,所引入的方法允许以简单、快速的方式比较具有不同特征的文本。

关键词

引用

@article{arxiv.1608.01965,
  title  = {Text authorship identified using the dynamics of word co-occurrence networks},
  author = {Camilo Akimushkin and Diego R. Amancio and Osvaldo N. Oliveira},
  journal= {arXiv preprint arXiv:1608.01965},
  year   = {2017}
}