PART:预训练作者身份表示Transformer
计算与语言
2025-05-12 v2
摘要
作者撰写文档时会在文本中留下身份识别信息:词汇、语域、标点、拼写错误,甚至表情符号的使用。以往工作使用手工特征或分类任务来训练其作者身份模型,导致在域外作者上表现不佳。使用文体学表示更为合适,但这本身是一个开放的研究挑战。本文中,我们提出PART,一个对比训练的模型,旨在学习\textbf{作者身份嵌入}而非语义。我们在属于1162位文学作者、17287位博客发布者和135个企业电子邮件账户的约150万篇文本上训练模型;这是一个具有可识别写作风格的异构集合。我们在当前挑战上评估该模型,取得了有竞争力的性能。我们还在数据集的测试划分上评估模型,在限定为250位作者时达到零样本72.39%准确率,比RoBERTa嵌入高出54%和56%。我们通过不同数据可视化对可用数据集上的表示进行定性评估,观察到作者的性别、年龄或职业等特征。
引用
@article{arxiv.2209.15373,
title = {PART: Pre-trained Authorship Representation Transformer},
author = {Javier Huertas-Tato and Alejandro Martin and David Camacho},
journal= {arXiv preprint arXiv:2209.15373},
year = {2025}
}