中文

一种用于文本作者身份识别的机器学习框架

计算与语言 2019-12-24 v1 信息检索 机器学习 机器学习

摘要

作者身份识别是确定文本作者的过程。大多数已知的文学文本可轻易归于某位作者,因为它们例如有署名。然而有时我们会发现未完成的作品或一大批可能作者各异的手稿。为评估此类手稿的重要性,知晓其作者至关重要。本工作中,我们旨在开发一种机器学习框架以有效判定作者身份。我们将该任务表述为单标签多类文本分类问题,并提出一种结合文体特征的有监督机器学习框架。该任务高度跨学科,其利用了机器学习、信息检索和自然语言处理。我们提出了一种方法和一个模型,其学习 5050 位不同作者间写作风格的差异,并能以高准确率预测新文本的作者是谁。在引入特定语言文体特征与文本特征后,准确率可见显著提升。

关键词

引用

@article{arxiv.1912.10204,
  title  = {A Machine Learning Framework for Authorship Identification From Texts},
  author = {Rahul Radhakrishnan Iyer and Carolyn Penstein Rose},
  journal= {arXiv preprint arXiv:1912.10204},
  year   = {2019}
}

备注

8 pages, 2 figures