中文

特征工程与 BERT 在 Twitter 数据上的比较

计算与语言 2022-10-31 v1 机器学习

摘要

在本文中,我们在三个数据集上比较了使用特征工程和词向量的传统机器学习模型,以及使用词嵌入的先进语言模型 BERT 的性能。我们还考虑了特征工程相对于 BERT 的时间和成本效率。从我们的结果中我们得出结论,BERT 模型的使用仅在用于比较的三个数据集之一上值得其时间与成本权衡,在该数据集上 BERT 模型显著优于任何使用特征向量而非嵌入向量的传统分类器。对其它数据集使用 BERT 模型仅分别实现了准确率和 F1 分数 0.03 和 0.05 的提升,可以说这使其使用不值得 GPU 的时间和成本。

关键词

引用

@article{arxiv.2210.16168,
  title  = {Feature Engineering vs BERT on Twitter Data},
  author = {Ryiaadh Gani and Lisa Chalaguine},
  journal= {arXiv preprint arXiv:2210.16168},
  year   = {2022}
}