CLASSLA-web:富含语言与体裁标注的南斯拉夫语支可比网络语料库
计算与语言
2024-05-28 v2
摘要
本文提出了一个高度可比的网络语料库集合,涵盖斯洛文尼亚语、克罗地亚语、波斯尼亚语、黑山语、塞尔维亚语、马其顿语和保加利亚语,从而覆盖了南斯拉夫语支空间的全部官方语言。这些语料库的集合包含来自 2600 万份文档的共 130 亿个词元。语料库的可比性通过可比的爬取设置和相同的爬取与后处理技术来保证。所有语料库均使用最先进的 CLASSLA-Stanza 语言处理流水线进行语言标注,并通过基于 Transformer 的多语言 X-GENRE 分类器丰富了文档级体裁信息,这进一步增强了语言标注和元数据丰富层面的可比性。对所得语料库的体裁聚焦分析表明,七个语料库中的体裁分布相当一致,最显著体裁类别的变化可以通过各语言社区的经济实力得到很好的解释。跨语料库的体裁类别分布比较表明,来自欠发达国家的网络语料库主要由新闻文章组成。相反,来自经济较发达国家的网络语料库表现出较小比例的新闻内容,而促销和观点性文本的存在更为显著。
引用
@article{arxiv.2403.12721,
title = {CLASSLA-web: Comparable Web Corpora of South Slavic Languages Enriched with Linguistic and Genre Annotation},
author = {Nikola Ljubešić and Taja Kuzman},
journal= {arXiv preprint arXiv:2403.12721},
year = {2024}
}
备注
Accepted to the LREC-COLING 2024 conference