19世纪奥斯曼与俄罗斯文学批评文本的多层次多标签文本分类数据集
计算与语言
2024-07-23 v1
摘要
本文介绍了一个包含3000多篇文档的多层次、多标签文本分类数据集。该数据集涵盖19世纪奥斯曼土耳其语和俄语的文学和批判性文本。这是首次将大语言模型(LLMs)应用于该数据集的数据集,数据来源于该时期的著名文学期刊。文本经过仔细组织和标记,依据考虑其结构和语义属性的分类框架进行分类和标记。文章按 bibliometric 元数据由人类专家分类和标记。我们使用经典的词袋(BoW)naive Bayes模型以及三种现代LLM(multilingual BERT、Falcon和Llama-v2) presented baseline classification results。我们发现,在某些情况下,词袋(BoW)超过大语言模型(LLM),强调在低资源语言环境中需要额外研究。这一数据集预计将为自然语言处理和机器学习领域的研究者提供宝贵资源,尤其是针对历史和低资源语言。该数据集公开可用^1。
引用
@article{arxiv.2407.15136,
title = {A multi-level multi-label text classification dataset of 19th century Ottoman and Russian literary and critical texts},
author = {Gokcen Gokceoglu and Devrim Cavusoglu and Emre Akbas and Özen Nergis Dolcerocca},
journal= {arXiv preprint arXiv:2407.15136},
year = {2024}
}