一种基于记忆的浅层自然语言模式学习方法
cmp-lg
2007-05-23 v3 计算与语言
摘要
识别浅层语言模式(如词间基本句法关系)是应用自然语言与文本处理中的常见任务。处理该任务的常规做法是繁琐地手工定义可能的模式结构,常以正则表达式或有限自动机形式呈现。本文提出一种新颖的基于记忆的学习方法,基于带括号标注的训练语料库识别新文本中的浅层模式。训练数据以原样存储在高效的后缀树数据结构中。泛化在识别时在线执行,通过将新文本的子序列与语料库中的正负证据进行比较。这样,训练中的信息不会丢失,这在训练时构建单一泛化模型的其他学习系统中可能发生。本文给出了识别英语名词短语、主谓及动宾模式的实验结果。由于该学习方法易于移植到新领域,我们计划将其应用于其他语言的句法模式及面向信息抽取的子语言模式。
引用
@article{arxiv.cmp-lg/9806011,
title = {A Memory-Based Approach to Learning Shallow Natural Language Patterns},
author = {Shlomo Argamon and Ido Dagan and Yuval Krymolowski},
journal= {arXiv preprint arXiv:cmp-lg/9806011},
year = {2007}
}
备注
27 pages. This is a revised and extended version of the paper presented in COLING-ACL '98. To appear in Journal of Experimental and Theoretical AI (JETAI) special issue on memory-based learning