中文

一元与二元分类方法及其对作者身份验证的影响

信息检索 2019-01-03 v1 计算与语言 机器学习 机器学习

摘要

检索索引文档时不依据其主题内容而是依据其写作风格,这为信息检索(IR)领域的诸多应用打开了大门。其中一种应用是检索特定作者 X 的文本内容,此时查询的 IR 系统会预先提供作者 X 的一组参考文本。作者身份验证(AV)是数字文本取证领域的一个研究课题,适用于此目的。AV 的任务是确定两篇文档(即一篇索引文档和一篇参考文档)是否由同一作者 X 撰写。尽管 AV 本质上是一个一元分类问题,但许多现有方法将其视为二元分类任务。然而,AV 方法的底层分类模型在其前提条件、可评估性和适用性方面具有诸多严重影响。在我们全面的文献回顾中,我们观察到关于一元和二元 AV 方法区分存在若干误解,需要予以考虑。因此,本文旨在通过提出明确的标准和新的属性来澄清这些误解,以期改进对现有和未来 AV 方法的表征。基于此,我们在两个自编语料库上研究了十一种现有的一元和二元 AV 方法以及四种通用一元分类算法的适用性。此外,我们强调了关于基于固定决策标准的 AV 方法评估的一个重要问题,这在以往的 AV 研究中未受到重视。

关键词

引用

@article{arxiv.1901.00399,
  title  = {Unary and Binary Classification Approaches and their Implications for Authorship Verification},
  author = {Oren Halvani and Christian Winter and Lukas Graner},
  journal= {arXiv preprint arXiv:1901.00399},
  year   = {2019}
}