作者验证方法的适用性评估
机器学习
2019-06-26 v1 计算与语言
机器学习
摘要
作者验证(AV)是数字文本取证领域的一个研究课题,关注两份文档是否由同一人所写的问题。在过去二十年中,可观察到提出的 AV 方法数量不断增加。然而,仔细审视相应研究后发现,这些方法的底层特性很少被提及,这引发了对其在真实取证场景中适用性的怀疑。本文的目标是通过提出明确的标准与属性来填补这一空白,旨在改进对现有及未来 AV 方法的刻画。基于这些属性,我们使用 12 种现有 AV 方法(包括当前最先进技术)进行了三个实验。所考察的方法在三个自行编纂的语料库上训练、优化和评估,每个语料库聚焦于适用性的不同方面。我们的结果表明,部分方法能够应对极具挑战的验证案例,例如 250 字符长的非正式聊天对话(72.7% 准确率)或两篇科学文档撰写时间平均相差 15.6 年的案例(>75% 准确率)。然而,我们也发现所有涉及的方法都易于受跨主题验证案例的影响。
引用
@article{arxiv.1906.10551,
title = {Assessing the Applicability of Authorship Verification Methods},
author = {Oren Halvani and Christian Winter and Lukas Graner},
journal= {arXiv preprint arXiv:1906.10551},
year = {2019}
}
备注
Paper has been accepted for publication in: The 14th International Conference on Availability, Reliability and Security (ARES 2019). arXiv admin note: text overlap with arXiv:1901.00399