中文

GerAV:在新基准上使用微调大语言模型迈向德语作者验证新高度

计算与语言 2026-04-24 v2

摘要

作者验证(AV)是判断两篇文本是否由同一作者所写的任务,已得到广泛研究,但主要针对英文数据。相比之下,针对其他语言的大规模基准和系统性评估仍然稀缺。我们通过引入GerAV来填补这一空白,这是一个用于德语AV的综合基准,包含超过40万对已标注的文本对。GerAV基于Twitter和Reddit数据构建,其中Reddit部分进一步划分为领域内和跨领域的基于消息的子集,以及一个基于用户资料的子集。这种设计能够对数据源、主题领域和文本长度的影响进行受控分析。利用提供的训练集划分,我们对强基线和最先进模型进行了系统性评估,发现我们的最佳方法——一个微调的大语言模型——在绝对F1分数上比近期基线高出0.09,并在零样本设置下超越GPT-5达0.08。我们进一步观察到专业化与泛化之间的权衡:在特定数据类型上训练的模型在匹配条件下表现最佳,但在不同数据体系下的泛化能力较差,这一局限性可以通过组合训练来源来缓解。总体而言,GerAV为推进德语及跨领域AV研究提供了一个具有挑战性且多功能的基准。我们的代码和数据访问信息可在GitHub上获取。

关键词

引用

@article{arxiv.2601.13711,
  title  = {GerAV: Towards New Heights in German Authorship Verification using Fine-Tuned LLMs on a New Benchmark},
  author = {Lotta Kiefer and Christoph Leiter and Sotaro Takeshita and Elena Schmidt and Steffen Eger},
  journal= {arXiv preprint arXiv:2601.13711},
  year   = {2026}
}