构建中世纪与前现代奥克语语料库
计算机视觉与模式识别
2019-04-29 v1
摘要
在(或多或少自由)可用数据量因数字语料库、版本或图书馆而显著增长的当下,数据挖掘工具或深度学习方法的开发使研究者能够构建契合其研究的语料库、丰富其数据并加以利用。开放光学字符识别(OCR)工具可适配旧版印刷品、摇篮本甚至手稿,取得可用结果,从而允许快速创建文本语料库。训练与校正阶段的交替使得通过快速积累原始文本数据来提升结果质量成为可能。这些文本随后可被结构化,例如采用 XML/TEI,并得以丰富。以图形或语言注释对文本进行丰富也可实现自动化。这些语言学家熟知且对现代语言有效的方法,对于诸如中世纪奥克语之类的语言存在困难,部分原因在于缺乏足够大的 lemmatized(词形还原)语料库。本文将提出创建适配古代语言巨大拼写变异工具的建议,以及针对中世纪与前现代奥克语词形还原的实验。这些技术为多种利用开辟了道路。可用优质文本与数据量的迫切增长,若人人都不辞劳苦将其数据自由在线发布并可复用,将有望改进数字语文学方法。通过以不同技术解决方案与若干微观分析为例,本文旨在展示数字语文学可为奥克语领域研究者提供的一部分能力,同时重申此类实践所基于的伦理议题。
引用
@article{arxiv.1904.11815,
title = {Producing Corpora of Medieval and Premodern Occitan},
author = {Jean-Baptiste Camps and Gilles Guilhem Couffignal},
journal= {arXiv preprint arXiv:1904.11815},
year = {2019}
}
备注
in French. Actes du XIIe Congr{\`e}s de l'Association internationale d'{\'e}tudes occitanes Albi, 2017, Association internationale d'{\'e}tudes occitanes (AIEO), Jul 2017, Albi, France