中文

文本分类中的错误驱动学习

cmp-lg 2008-02-03 v1 计算与语言

摘要

文本处理领域的学习问题通常将文本映射到维度为文本测度特征的空间,例如其单词。在该领域有三个特征属性:(a) 极高维度,(b) 所学概念和实例在特征空间中稀疏分布,(c) 单个实例中活跃特征数量高度变化。本文研究了用于此类典型任务的三种错误驱动学习算法。我们认为这些算法——通过在特征空间中学习线性分离器来对文档进行分类——具有使它们适合该领域的几个属性。我们然后展示了当进一步修改算法以更好地解决该领域的特定特征时,性能实现了量级的提升。特别地,我们演示了:(1) 通过规范化特征权重或使用负权重来容忍文档长度的变化,(2) 在训练中应用阈值范围的积极影响,(3) 在考虑特征频率方面的替代方案,以及(4) 在训练期间丢弃特征的好处。总体而言,我们提出了一种算法(Littlestone 的 Winnow 的一种变体),在使用类似特征集进行此任务时,性能显著优于任何其他算法。

关键词

引用

@article{arxiv.cmp-lg/9706007,
  title  = {Aggregate and mixed-order Markov models for statistical language processing},
  author = {Lawrence Saul and Fernando Pereira},
  journal= {arXiv preprint arXiv:cmp-lg/9706007},
  year   = {2008}
}

备注

9 pages, 4 PostScript figures, uses psfig.sty and aclap.sty; to appear in the proceedings of EMNLP-2