训练文本分类器的顺序算法
cmp-lg
2008-02-03 v2 计算与语言
摘要
廉价训练文本分类器的能力对于其在信息检索、内容分析、自然语言处理以及其他涉及部分或完全文本数据任务中使用至关重要。开发并测试了一个用于机器学习统计分类器期间的顺序抽样算法,测试于新闻稿分类任务。该方法,我们称为不确定性抽样,能够将实现给定有效性所需的手动分类训练数据的数量缩减最多500倍。
引用
@article{arxiv.cmp-lg/9407020,
title = {A Sequential Algorithm for Training Text Classifiers},
author = {David D. Lewis and William A. Gale},
journal= {arXiv preprint arXiv:cmp-lg/9407020},
year = {2008}
}
备注
10 pages, uuencoded, compressed PostScript; Proc. SIGIR-94 LaTex available from [email protected]