利用语境识别词汇原子——语言语境的统计视角
cmp-lg
2008-02-03 v1 计算与语言
摘要
自然语言的解释本质上是具有语境依赖性的。自然语言中大多数单词都含有歧义,其意义高度依赖于其使用的语言语境。词汇语义的研究不能脱离语境概念而开展。本文采取语境方法论,研究词汇原子(即“黏性”短语如“hot dog”)的语言语境。由于此类词汇原子在不受限制的自然语言文本中可能频繁出现,因此识别它们对于理解自然发生的文本至关重要。本文提出了几种启发式方法,利用语言语境从任意自然语言文本中识别词汇原子。
引用
@article{arxiv.cmp-lg/9701001,
title = {Exploiting Context to Identify Lexical Atoms -- A Statistical View of Linguistic Context},
author = {Chengxiang Zhai},
journal= {arXiv preprint arXiv:cmp-lg/9701001},
year = {2008}
}
备注
10 pages, postscript file, to appear in Proceedings of International and Interdisciplinary Conference on Modelling and Using Context (CONTEXT-97)