基于转换学习的文本分块
cmp-lg
2009-09-25 v1 计算与语言
摘要
Eric Brill 提出了转换学习方法,并展示了其可对词性标注任务取得相当高的准确率。该方法同样可被应用于文本解释的更高层次,用于在标注后的文本中定位文本块,包括非递归的“baseNP”块。为此,将文本块观察为 tagging 问题比较方便,将块结构编码为附加于每个单词的新标签。在使用由 Treebank 衍生数据进行的自动测试中,此技术对 baseNP 块实现了约 92% 的召回率和精确率,对稍复杂的块(句子划分块)实现了 88% 的召回率和精确率。本应用还提出了一些针对转换学习方法的有趣改进。
引用
@article{arxiv.cmp-lg/9505040,
title = {Text Chunking using Transformation-Based Learning},
author = {Lance A. Ramshaw and Mitchell P. Marcus},
journal= {arXiv preprint arXiv:cmp-lg/9505040},
year = {2009}
}
备注
13 pages, LaTeX2e, 1 included figure