中文

利用多语言训练进行作者表征:增强跨语言和跨领域的泛化能力

计算与语言 2025-09-23 v1

摘要

作者表征(AR)学习,即对作者独特写作风格进行建模,已在作者归属任务中展现出强大的性能。然而,先前的研究主要集中在单语环境(主要是英语),多语言AR模型的潜在优势尚未得到充分探索。我们提出了一种新颖的多语言AR学习方法,包含两项关键创新:概率内容掩码,鼓励模型关注风格指示性词汇而非内容特定词汇;以及语言感知批处理,通过减少跨语言干扰来改进对比学习。我们的模型在跨越36种语言和13个领域的超过450万作者的数据上进行了训练。在22种非英语语言中的21种语言上,它持续优于单语基线,平均Recall@8提升了4.85%,在单一语言中最大提升达15.91%。此外,与仅使用英语训练的单语模型相比,它展现出更强的跨语言和跨领域泛化能力。我们的分析证实了所提出的两种技术的有效性,突出了它们在模型性能提升中的关键作用。

关键词

引用

@article{arxiv.2509.16531,
  title  = {Leveraging Multilingual Training for Authorship Representation: Enhancing Generalization across Languages and Domains},
  author = {Junghwan Kim and Haotian Zhang and David Jurgens},
  journal= {arXiv preprint arXiv:2509.16531},
  year   = {2025}
}

备注

Accepted to EMNLP 2025