从语料库进行监督训练时降低手动标注成本
cmp-lg
2008-02-03 v1 计算与语言
摘要
语料库方法用于自然语言处理通常采用监督训练,需对训练语料进行昂贵的手动标注。本文研究通过{it 样本选择}来降低标注成本的方法。在此方法中,训练期间学习程序检查大量未标注实例,仅为最具信息性的实例选择进行标注(标注)。这避免了对贡献信息有限的实例进行冗余标注。本文扩展了我们之前用于概率分类器的{it committee-based sample selection}工作。我们描述了一系列基于委员会的样本选择方法,并报告了随机词性标Tagging任务的实验结果。我们发现,所有变体均实现了显著的标注成本降低,尽管其计算效率不同。特别是,最简单的方法无需调参,效果 Excellent。我们还展示了样本选择显著减少了标记器所使用的模型大小。
引用
@article{arxiv.cmp-lg/9606030,
title = {Minimizing Manual Annotation Cost In Supervised Training From Corpora},
author = {Sean P. Engelson and Ido Dagan},
journal= {arXiv preprint arXiv:cmp-lg/9606030},
year = {2008}
}
备注
8 pages, uses epsf.sty and aclap.sty, 6 postscript figures