中文

基于BERT的罗马尼亚语ROST数据集作者归属识别

人工智能 2023-01-31 v1

摘要

作者归属问题虽已存在数十年,目前仍备受关注。一些较新的工具使用了预训练语言模型,其中最为流行的是BERT。此处我们使用此类模型来检测罗马尼亚语文本的作者是谁。所用数据集高度不平衡,即每位作者的文本数量、文本收集来源、作者生活和写作的时间段、预期阅读媒介(纸本或在线)以及写作类型(故事、短篇小说、童话、小说、文学文章和随笔)均存在显著差异。结果好于预期,有时宏准确率超过87%。

关键词

引用

@article{arxiv.2301.12500,
  title  = {BERT-based Authorship Attribution on the Romanian Dataset called ROST},
  author = {Sanda-Maria Avram},
  journal= {arXiv preprint arXiv:2301.12500},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2211.05180