中文

基于功能词邻接网络的作者归属

计算与语言 2015-10-28 v1 机器学习 机器学习

摘要

本文介绍了一种基于功能词邻接网络 (WANs) 的作者归属方法。功能词是表达其他词汇之间语法关系但自身不携带词汇意义的词类。在本文的 WANs 中,节点为功能词,有向边代表在源词有序邻域内发现汇词的可能性。不同作者的 WANs 可被解释为马尔可夫链的转移概率,因此通过相对熵进行比较。研究了 WANs 参数的优化选择,并在多样化的作者群体和不同的文本长度下对归属准确率进行了基准测试。分析表明,由于功能词独立于内容,其使用往往具有作者特异性,且功能 WANs 捕获的关系数据是风格指纹的良好总结。观察到的归属准确率超过了仅依赖词频的方法。进一步将 WANs 与仅依赖词频的方法相结合,可获得更高的归属准确率,表明这两类信息源编码了作者风格的不同方面。

关键词

引用

@article{arxiv.1406.4469,
  title  = {Authorship Attribution through Function Word Adjacency Networks},
  author = {Santiago Segarra and Mark Eisen and Alejandro Ribeiro},
  journal= {arXiv preprint arXiv:1406.4469},
  year   = {2015}
}