面向揭开维多利亚期刊神秘面纱的开放集作者归属
计算与语言
2019-12-19 v1
摘要
计算作者归属(AA)的现有研究主要关注在封闭集配置下具有有限数量作者的归属任务。这种受限设置远不能真实处理高度纠缠的现实世界 AA 任务,后者在测试时涉及大量候选作者需要归属。在本文中,我们使用从维多利亚文学编译的新数据集研究历史文本中的 AA。我们考察了最常见英文单词在区分最著名维多利亚小说家著作方面的预测能力。我们挑战了封闭集分类假设,并讨论了标准机器学习技术在处理开放集 AA 任务时的局限性。我们的实验表明,在封闭集假设下线性分类器可达到近乎完美的归属准确率,然而一旦在开放集分类设置中必须考虑大型候选池,对更鲁棒方法的需求便显而易见。
引用
@article{arxiv.1912.08259,
title = {Open Set Authorship Attribution toward Demystifying Victorian Periodicals},
author = {Sarkhan Badirli and Mary Borgo Ton and Abdulmecit Gungor and Murat Dundar},
journal= {arXiv preprint arXiv:1912.08259},
year = {2019}
}