BERT 与传统机器学习文本分类的比较
计算与语言
2023-04-26 v2 机器学习
机器学习
摘要
BERT 模型近年来已成为一种流行的先进机器学习模型,能够在无人类监督的情况下应对诸如监督式文本分类等多种 NLP 任务。其应对任意类型语料并给出优异结果的灵活性,使该方法不仅在学术界也在工业界广受欢迎。尽管多年来已有许多不同的方法被成功使用。在这项工作中,我们首先介绍 BERT 并包括对经典 NLP 方法的简要回顾。然后,我们通过一套应对不同场景的实验,实证检验 BERT 相对于输入传统 TF-IDF 词表的机器学习算法的表现。本工作的目的是增添实证证据,以支持或反对在 NLP 任务中默认使用 BERT。实验显示了 BERT 的优越性及其对 NLP 问题特征(如文本语言)的独立性,为在 NLP 问题中使用 BERT 作为默认技术增添了实证证据。
引用
@article{arxiv.2005.13012,
title = {Comparing BERT against traditional machine learning text classification},
author = {Santiago González-Carvajal and Eduardo C. Garrido-Merchán},
journal= {arXiv preprint arXiv:2005.13012},
year = {2023}
}
备注
12 pages