中文

利用语言发散性改进作者验证

计算与语言 2021-03-15 v1 信息检索 机器学习

摘要

我们针对作者验证任务提出一种无监督解决方案,其利用预训练深度语言模型计算一种称为 DV-Distance 的新度量。所提度量衡量两位作者相对于预训练语言模型的差异。我们的设计解决了作者验证中常见于小规模或跨领域语料的非可比性问题。据我们所知,本文是首篇从根本上面向非可比性而设计方法、而非间接处理的论文,也是首批在此场景下使用深度语言模型的论文之一。该方法直观,且可通过可视化轻松理解与解释。在四个数据集上的实验表明,我们的方法在大多数任务上匹配或超越了当前最先进方法与强基线。

关键词

引用

@article{arxiv.2103.07052,
  title  = {Improving Authorship Verification using Linguistic Divergence},
  author = {Yifan Zhang and Dainis Boumber and Marjan Hosseinia and Fan Yang and Arjun Mukherjee},
  journal= {arXiv preprint arXiv:2103.07052},
  year   = {2021}
}

备注

Published in ROMCIR 2021. Workshop held as part of ECIR 2021. March 28 - April 1, 2021