基于BERT的罗马尼亚语ROST数据集作者归属识别
人工智能
2023-01-31 v1
摘要
作者归属问题虽已存在数十年,目前仍备受关注。一些较新的工具使用了预训练语言模型,其中最为流行的是BERT。此处我们使用此类模型来检测罗马尼亚语文本的作者是谁。所用数据集高度不平衡,即每位作者的文本数量、文本收集来源、作者生活和写作的时间段、预期阅读媒介(纸本或在线)以及写作类型(故事、短篇小说、童话、小说、文学文章和随笔)均存在显著差异。结果好于预期,有时宏准确率超过87%。
引用
@article{arxiv.2301.12500,
title = {BERT-based Authorship Attribution on the Romanian Dataset called ROST},
author = {Sanda-Maria Avram},
journal= {arXiv preprint arXiv:2301.12500},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2211.05180