中文

自动文本分类中的机器学习

信息检索 2021-09-21 v1 机器学习

摘要

文本自动分类(或分类)进入 predefined 类别中过去十年间 witnessed 了巨大的兴趣,这是由于数字形式文档的大量可用性以及随之而来的需要对其进行组织所致。在研究社区,解决此问题的主导方法基于机器学习技术:一种通用的归纳过程通过学习从预先分类的文档集中学习类别特征来自动构建分类器。相较于知识工程方法(即由领域专家手动定义分类器),这种方法的优势在于效果极佳、在专家人力方面具有显著节省,并且易于移植到不同领域。本综述讨论了落实于机器学习范式内的文本分类方法。我们将详细讨论三个不同问题相关的议题,分别是:文档表示、分类器构建和分类器评估。

关键词

引用

@article{arxiv.cs/0110053,
  title  = {Machine Learning in Automated Text Categorization},
  author = {Fabrizio Sebastiani},
  journal= {arXiv preprint arXiv:cs/0110053},
  year   = {2021}
}

备注

Accepted for publication on ACM Computing Surveys