中文

基于压缩模型的作者身份验证

信息检索 2017-06-05 v1

摘要

压缩模型为不同分类任务提供了一种有趣的方法,已在许多研究领域广泛使用。我们将压缩模型应用于作者身份验证(AV)领域,这是数字文本取证的一个分支。AV的任务是验证一份存疑文档与一份已知作者的参考文档是否由同一人撰写。我们提出一种内在AV方法,与当前基于支持向量机或神经网络的多种最先进方法相比,取得了有竞争力的结果。然而,与这些方法不同,我们的方法不使用机器学习算法、自然语言处理技术、特征工程、超参数优化或外部文档(一种将AV从单类转化为多类分类问题的常用策略)。相反,我们方法的仅有的三个关键组成部分是:一个压缩算法、一个相异性度量和一个用于接受或拒绝存疑文档作者身份的阈值。由于其紧凑性,我们的方法执行速度非常快,且能以最小的工作量重新实现。此外,该方法能处理存疑文档与参考文档在主题或体裁上互不相关的复杂AV案例。我们在三个国际AV竞赛中使用的公开数据集上评估了我们的方法。此外,我们构建了自己的语料库,在这些语料库上将我们的方法与最先进方法进行了评估,并在两种情况下都取得了有前景的结果。

关键词

引用

@article{arxiv.1706.00516,
  title  = {Authorship Verification based on Compression-Models},
  author = {Oren Halvani and Christian Winter and Lukas Graner},
  journal= {arXiv preprint arXiv:1706.00516},
  year   = {2017}
}