作为多维语言数据分析框架的标注图
计算与语言
2007-05-23 v1
摘要
在近期工作中,我们提出了一种基于标记无环有向图的语言标注形式框架。这些“标注图”提供了一种简单而强大的方法,用于表示包含层次与重叠的复杂标注结构。在此,我们利用取自 CALLHOME、COCONUT、MUC-7、DAMSL 与 TRAINS 标注方案的文本与语音数据的语篇级标注,来阐释我们的方法动机与实例。在领域专家协助下,我们为波士顿大学广播语音语料库(Boston University Radio Speech Corpus)的一个片段构建了混合多层级标注,包含如下层级:片段、词、呼吸、ToBI、Tilt、Treebank、共指与命名实体。我们展示了标注图如何表示源自多种文件格式的混合多层级结构。我们还展示了该方法如何便于基于不同理论模型对单一信号的多重标注进行实质性比较。讨论表明标注图如何为工具、格式与语料库的广泛集成敞开大门。
引用
@article{arxiv.cs/9907003,
title = {Annotation graphs as a framework for multidimensional linguistic data analysis},
author = {Steven Bird and Mark Liberman},
journal= {arXiv preprint arXiv:cs/9907003},
year = {2007}
}
备注
10 pages, 10 figures, Towards Standards and Tools for Discourse Tagging, Proceedings of the Workshop. pp. 1-10. Association for Computational Linguistics