中文

学习用于作者身份分析的文体计量表征

计算与语言 2016-06-06 v1 计算机与社会 社会与信息网络

摘要

作者身份分析(AA)旨在从呈指数级爆炸增长的文本数据中揭示作者的隐藏属性。它根据文本中反映的写作风格,提取作者的身份和社会语言学特征。这是网络犯罪调查、心理语言学、政治社会化等多个领域的关键过程。然而,以往的大多数技术严重依赖于人工特征工程过程。因此,特征集的选择已被证明依赖于具体场景或数据集。本文为了利用神经网络方法模拟人类的句子组合过程,提出将不同类别的语言特征融入词的分布式表示中,以便基于未标注文本同时学习用于作者身份分析的写作风格表征。具体而言,所提出的模型允许将每篇文档的主题、词汇、句法和字符级特征向量提取为文体计量特征。我们在 Twitter、小说和论文数据集上,针对作者特征刻画和作者验证问题评估了该方法的性能。实验表明,我们提出的文本表征优于词法 n-gram 词袋、潜在狄利克雷分配(Latent Dirichlet Allocation)、潜在语义分析(Latent Semantic Analysis)、PVDM、PVDBOW 和 word2vec 表征。

关键词

引用

@article{arxiv.1606.01219,
  title  = {Learning Stylometric Representations for Authorship Analysis},
  author = {Steven H. H. Ding and Benjamin C. M. Fung and Farkhund Iqbal and William K. Cheung},
  journal= {arXiv preprint arXiv:1606.01219},
  year   = {2016}
}