中文

基于前馈神经网络语言模型的特定领域作者归属

计算与语言 2016-02-25 v1 机器学习 神经与进化计算

摘要

作者归属(authorship attribution)是指基于给定文本样本自动确定作者的任务。这是一个具有悠久历史且应用广泛的问题。使用语言模型构建作者档案是自动化此任务最成功的方法之一。基于神经网络的新型语言建模方法缓解了维度灾难,通常优于传统的 N-gram 方法。然而,将它们应用于作者归属的研究还不多。在本文中,我们提出了一种神经网络语言模型(Neural Network Language Model, NNLM)的新设置,并将其应用于来自不同作者的文本样本数据库。我们研究了 NNLM 在中等作者集合规模和相对有限的训练与测试数据任务上的表现,以及文本样本的主题如何影响准确率。NNLM 在困惑度(perplexity,衡量训练语言模型对测试数据拟合程度的指标)上实现了近 2.5% 的降低。给定 5 个随机测试句子,与使用 SRILM 工具的 N-gram 方法相比,它还将作者分类准确率平均提高了 3.43%。我们方法的开源实现可在 https://github.com/zge/authorship-attribution/ 免费获取。

关键词

引用

@article{arxiv.1602.07393,
  title  = {Domain Specific Author Attribution Based on Feedforward Neural Network Language Models},
  author = {Zhenhao Ge and Yufang Sun},
  journal= {arXiv preprint arXiv:1602.07393},
  year   = {2016}
}

备注

International Conference on Pattern Recognition Application and Methods (ICPRAM) 2016