为语言学现场数据开发开放数据模型
数字图书馆
2007-05-23 v1 计算与语言
摘要
UQ Flint 档案馆保存了 Elwyn Flint 在 1950 和 1960 年代期间,对澳大利亚昆士兰州进行大规模语言调查所收集的现场笔记和录音记录。对 UQ Flint 档案馆内容进行数字化在 EMELD 语境下带来了若干有趣的挑战。首先,所有语言数据均涉及濒危或濒临灭绝的语言,因而构成了宝贵的民族志资料库。其次,数据物理格式正面临衰败风险,数字化是短期至中期保存的重要任务。第三,采用开放标准对文本和音频数据进行编码与呈现虽有助于保存,但本身构成了一个尚未形成最佳实践的全新研究领域。第四,作为新的研究数据源在线提供存在数据可移植性与持久性等问题。本文将阐述数据模型的来由、内容创建组件、基于数据模型的呈现形式、数据捕获工具及媒体转换组件。我们还将就语言学现场工作的数字化与标注等大问题作出说明,这些都源自我们对 Flint 档案馆内容的实际经验。
引用
@article{arxiv.cs/0305053,
title = {Developing Open Data Models for Linguistic Field Data},
author = {Baden Hughes},
journal= {arXiv preprint arXiv:cs/0305053},
year = {2007}
}