中文

使用神经网络语言模型的作者归属识别

计算与语言 2016-02-18 v1 人工智能

摘要

在实践中,由于数据资源有限,为单个作者训练语言模型通常代价高昂。在此类情况下,神经网络语言模型(NNLMs)通常优于传统的非参数 N-gram 模型。本文中,我们研究了一个前馈 NNLM 在作者归属问题上的性能,该问题具有中等规模的作者集合和相对有限的数据。我们还考虑了文本主题如何影响性能。与构建良好的带有 Kneser-Ney 平滑的 N-gram 基线方法相比,所提方法在给定少至 5 个测试句子的情况下,实现了困惑度降低近 2:5%,并将作者分类准确率平均提高 3:43%。该性能在准确率和测试数据需求方面与最先进水平(state of the art)极具竞争力。源代码、预处理数据集、方法论与结果的详细描述可在 https://github.com/zge/authorship-attribution 获取。

关键词

引用

@article{arxiv.1602.05292,
  title  = {Authorship Attribution Using a Neural Network Language Model},
  author = {Zhenhao Ge and Yufang Sun and Mark J. T. Smith},
  journal= {arXiv preprint arXiv:1602.05292},
  year   = {2016}
}

备注

Proceedings of the 30th AAAI Conference on Artificial Intelligence (AAAI'16)