中文

基于BERT与特征模型的集成集成用于日本文学作品作者归属

计算与语言 2025-04-14 v1

摘要

传统上,作者归属任务依赖于基于从文本中提取的风格特征的统计数据分析和分类。近年来,预训练语言模型在文本分类任务中引起了广泛关注。然而,尽管它们在大规模短文本数据集上表现出色,但在小样本(尤其是作者归属任务)中的有效性仍未得到充分探索。此外,一个关键挑战是如何有效利用预训练语言模型与传统的基于特征的方法相结合,以推进作者归属研究。在本研究中,我们旨在通过将传统的基于特征的方法与现代基于预训练语言模型的方法进行集成集成,在小样本的作者归属任务上显著提升性能。实验使用了两个文学作品语料库,每个语料库对10位作者进行分类。结果表明,即使对于小样本的作者归属任务,BERT也是有效的。基于BERT的集成和分类器集成均优于各自的独立模型,而集成集成方法进一步显著提高了分数。对于未包含在预训练数据中的语料库,与性能最佳的单模型相比,集成集成将F1分数提高了约14个百分点。我们的方法为在可预见的未来高效使用不断扩展的数据处理工具集提供了一种可行的解决方案。

关键词

引用

@article{arxiv.2504.08527,
  title  = {Integrated ensemble of BERT- and features-based models for authorship attribution in Japanese literary works},
  author = {Taisei Kanda and Mingzhe Jin and Wataru Zaitsu},
  journal= {arXiv preprint arXiv:2504.08527},
  year   = {2025}
}