相同还是不同?用于作者身份分析的 Diff-Vectors
机器学习
2023-01-25 v1 人工智能
摘要
我们研究了对给定为监督学习器输入的文档的向量表示在概念上的根本转变对作者身份识别任务的影响。在“经典”作者身份分析中,特征向量表示一篇文档,特征值表示特征在文档中相对频率的(增函数),类标签表示文档作者。我们转而研究如下情形:特征向量表示无序文档对,特征值表示特征在两文档中相对频率(或其增函数)的绝对差异,类标签指示两文档是否来自同一作者。后一种(与学习器无关的)表示类型此前偶有使用,但从未被系统研究。我们认为其具有优势,且在某些情况下(如作者身份验证)相较标准表示为训练过程提供了更大量的信息。我们在多个公开数据集(其中一个为我们此处首次发布)上进行的实验表明,表示文档对的特征向量(我们在此称为 Diff-Vectors)系统性地提升了作者身份识别任务的效果,尤其在训练数据稀缺时(如现实作者身份识别场景常见)更为显著。我们的实验涵盖同作者验证、作者身份验证和闭集作者身份归因;尽管 DVs 天然适用于解决第 1 类,我们也提供两种利用第 1 类求解器作为构建模块来解决第 2 和第 3 类的新方法。
引用
@article{arxiv.2301.09862,
title = {Same or Different? Diff-Vectors for Authorship Analysis},
author = {Silvia Corbara and Alejandro Moreo and Fabrizio Sebastiani},
journal= {arXiv preprint arXiv:2301.09862},
year = {2023}
}