面向数据的语言处理:综述
cmp-lg
2008-02-03 v1 计算与语言
摘要
在过去几年中,一种新的语言处理方法开始出现,它以不同的标签为人所知,如"面向数据解析"、"基于语料库的阐释"和"树库语法"(参见van den Berg等人1994年;Bod 1992-96年;Bod等人1996a/b年;Bonnema 1996年;Charniak 1996a/b年;Goodman 1996年;Kaplan 1996年;Rajman 1995a/b年;Scha 1990-92年;Sekine & Grishman 1995年;Sima'an等人1994年;Sima'an 1995-96年;Tugwell 1995年)。我们称之为"面向数据处理"或"DOP"的方法,体现了人类语言感知和生产使用先前语言经历的具体表示而非抽象语言规则的假设。实现这一方法的模型因此维护着大量先前出现语句的语言表示语料库。当处理新的输入语句时,通过组合语料库中的片段来构建该语句的分析;片段的出现频率被用来估计哪种分析是最可能的。在本文中,我们深入讨论了一种使用带标签短语结构树语料库的面向数据处理模型。然后我们回顾了其他一些实现DOP方法的模型。其中许多模型也使用带标签短语结构树,但使用不同的标准从语料库中提取片段或采用不同的消歧策略(Bod 1996b;Charniak 1996a/b;Goodman 1996;Rajman 1995a/b;Sekine & Grishman 1995;Sima'an 1995-96);其他模型则为其语料库注释使用更丰富的形式化方法(van den Berg等人1994年;Bod等人1996a/b;Bonnema 1996年;Kaplan 1996年;Tugwell 1995年)。
引用
@article{arxiv.cmp-lg/9611003,
title = {Data-Oriented Language Processing. An Overview},
author = {Rens Bod and Remko Scha},
journal= {arXiv preprint arXiv:cmp-lg/9611003},
year = {2008}
}
备注
34 pages, Postscript