中文

整合词库与训练集用于文本分类

cmp-lg 2008-02-03 v1 计算与语言

摘要

自动文本分类是许多自然语言处理应用中复杂且有用的任务。近期文本分类方法更关注算法而非所涉及的操作资源。与这一趋势相反,我们提出了一种基于整合广泛可用资源——词库和训练集——来克服当前任务局限性的方法。我们的方法利用WordNet同义信息来增强训练不足类别的证据。在测试直接分类、基于WordNet的分类、训练算法以及我们的整合方法时,后者的表现优于其他任何方法。顺便提及,基于WordNet的方法性能与训练方法相当。

关键词

引用

@article{arxiv.cmp-lg/9709004,
  title  = {Integrating a Lexical Database and a Training Collection for Text Categorization},
  author = {Jose Maria Gomez Hidalgo and Manuel de Buenaga Rodriguez},
  journal= {arXiv preprint arXiv:cmp-lg/9709004},
  year   = {2008}
}

备注

12 pages, 3 figures (2 tables)