ALMs:用于作者身份归因的作者语言模型
计算与语言
2024-02-14 v2
摘要
在本文中,我们介绍了一种称为作者语言模型(ALMs)的作者身份归因方法,该方法基于对一组候选作者的著作进行微调的一组因果语言模型,计算待鉴定文档的困惑度,从而识别出该文档最可能的作者。我们使用CCAT50数据集和Blogs50数据集,将ALMs与最先进的系统进行了基准测试。我们发现,ALMs在Blogs50上取得了83.6%的宏平均准确率,优于所有其他方法;在CCAT50上取得了74.9%的宏平均准确率,与最佳方法的性能相当。为了评估ALMs在较短文本上的性能,我们还进行了文本消融测试。我们发现,要达到70%的宏平均准确率,ALMs在Blogs50上需要40个词元,在CCAT50上需要400个词元;而达到60%的准确率,ALMs在Blogs50上需要20个词元,在CCAT50上需要70个词元。
引用
@article{arxiv.2401.12005,
title = {ALMs: Authorial Language Models for Authorship Attribution},
author = {Weihang Huang and Akira Murakami and Jack Grieve},
journal= {arXiv preprint arXiv:2401.12005},
year = {2024}
}