整合词库与训练集用于文本分类
cmp-lg
2008-02-03 v1 计算与语言
摘要
自动文本分类是许多自然语言处理应用中复杂且有用的任务。近期文本分类方法更关注算法而非所涉及的操作资源。与这一趋势相反,我们提出了一种基于整合广泛可用资源——词库和训练集——来克服当前任务局限性的方法。我们的方法利用WordNet同义信息来增强训练不足类别的证据。在测试直接分类、基于WordNet的分类、训练算法以及我们的整合方法时,后者的表现优于其他任何方法。顺便提及,基于WordNet的方法性能与训练方法相当。
引用
@article{arxiv.cmp-lg/9709004,
title = {Integrating a Lexical Database and a Training Collection for Text Categorization},
author = {Jose Maria Gomez Hidalgo and Manuel de Buenaga Rodriguez},
journal= {arXiv preprint arXiv:cmp-lg/9709004},
year = {2008}
}
备注
12 pages, 3 figures (2 tables)