中文

基于 BERT 语言模型的大规模新闻分类:Spark NLP 方法

计算与语言 2021-11-05 v2 计算复杂性 机器学习

摘要

在 NLP 之上大数据分析的增长加剧了大规模文本处理的计算负担。NLP 面临的问题是非常高维的文本,因此需要高昂的计算资源。MapReduce 允许大规模计算的并行化,并能提升文本处理效率。本研究旨在基于深度学习方法研究大数据处理对 NLP 任务的影响。我们使用微调 BERT 的预训练模型对大规模新闻主题文本进行分类。本研究使用了五个参数数量不同的预训练模型。为衡量该方法效率,我们将 BERT 与 Spark NLP 的流水线性能进行比较。结果表明,不带 Spark NLP 的 BERT 比带 Spark NLP 的 BERT 准确率更高。所有模型使用 BERT 的平均准确率与训练时间分别为 0.9187 与 35 分钟,而使用 BERT 加 Spark NLP 流水线分别为 0.8444 与 9 分钟。模型越大将消耗更多计算资源并需要更长时间完成任务。然而,相比不带 Spark NLP 的 BERT,带 Spark NLP 的 BERT 准确率仅平均下降 5.7%,而训练时间显著减少了 62.9%。

关键词

引用

@article{arxiv.2107.06785,
  title  = {Large-Scale News Classification using BERT Language Model: Spark NLP Approach},
  author = {Kuncahyo Setyo Nugroho and Anantha Yullian Sukmadewa and Novanto Yudistira},
  journal= {arXiv preprint arXiv:2107.06785},
  year   = {2021}
}