土耳其文本的标注与形态学消歧
cmp-lg
2008-02-03 v1 计算与语言
摘要
自动文本标注是语料库高层分析的重要组成部分,其输出可用于许多自然语言处理应用。在土耳其语或芬兰语等具有黏着形态的语言中,形态学消歧是标注过程中非常关键的步骤,因为许多词汇形式的结构在形态学上是模糊的。本文描述了一个基于土耳其语形态学完整双层规范的土耳其文本词性标注器,该标注器基于约 24,000 个词根的词典。该标注器还配备了多词和惯用结构识别器,最重要的是基于局部邻域约束、启发式方法和有限统计信息的形态学消歧器。标注器还具备统计编译和形态学分析器微调的功能,例如记录错误的形态学解析、常用词根等。初步结果表明,该标注器可以在极少人工干预下准确标注约 98-99% 的文本。此外,对于经过标注器进行形态学消歧的句子,为土耳其语开发的 LFG 解析器平均生成少 50% 的歧义解析,且解析速度快约 2.5 倍。标注功能并非土耳其语特有,只要具备适当的形态学分析接口,即可应用于任何语言。
引用
@article{arxiv.cmp-lg/9407026,
title = {Tagging and Morphological Disambiguation of Turkish Text},
author = {Kemal Oflazer and Ilker Kuruoz},
journal= {arXiv preprint arXiv:cmp-lg/9407026},
year = {2008}
}
备注
To appear in Proceedings of 4th ACL-ANLP Conf. uuencoded gzip'ed postscript file, 6 pages