中文

Opera Graeca Adnotata:构建一个 3400 万词元以上的古希腊语多层语料库

计算与语言 2024-04-02 v1

摘要

在本文中,我们介绍了 Opera Graeca Adnotata (OGA) 的 0.1.0 测试版,这是最大的面向古希腊语(AG)的开放获取多层语料库。OGA 包含 1,687 部文学作品和超过 3400 万个词元,它们来自 PerseusDL 和 OpenGreekAndLatin GitHub 仓库,这些仓库托管了时间跨度约为公元前 800 年至公元 250 年的 AG 文本。这些文本已被丰富了七个标注层: 词元切分层; 句子分割层; 词形还原层; 形态学层; 依存层; 依存功能层; Canonical Text Services (CTS) 引用层。我们通过强调遇到的主要技术和标注相关问题来描述每一层的创建过程。词元切分、句子分割和 CTS 引用由基于规则的算法执行,而形态句法标注是在古希腊语依存树库数据上训练的 COMBO 解析器的输出。为了可扩展性和可重用性,该语料库以 standoff 格式 PAULA XML 及其衍生格式 LAULA XML 发布。

关键词

引用

@article{arxiv.2404.00739,
  title  = {Opera Graeca Adnotata: Building a 34M+ Token Multilayer Corpus for Ancient Greek},
  author = {Giuseppe G. A. Celano},
  journal= {arXiv preprint arXiv:2404.00739},
  year   = {2024}
}