基于变换器的双向编码器表示(BERT):一段情感分析探索之旅
计算与语言
2020-07-03 v1 机器学习
摘要
本研究旨在探讨四种不同情感分析技术的相对有效性:(1)使用Sent WordNet的无监督基于词典的模型;(2)使用逻辑回归的传统监督机器学习模型;(3)使用长短期记忆网络(LSTM)的监督深度学习模型;以及(4)使用基于变换器的双向编码器表示(BERT)的先进监督深度学习模型。我们使用互联网电影数据库(IMDB)上公开的包含50,000条电影评论的标注语料库,分别利用Sent WordNet词典、逻辑回归、LSTM和BERT进行分析。前三个模型在基于CPU的系统上运行,而BERT在基于GPU的系统上运行。情感分类性能基于准确率、精确率、召回率和F1分数进行评估。本研究提出了两个关键见解:(1)四种高度先进且广泛使用的情感分析技术的相对效能;(2)预训练的先进监督深度学习BERT模型在文本数据情感分析中无可争议的优越性。本研究为分析行业的专业人士和从事文本分析工作的学者提供了关于关键情感分析技术(包括最近开发的BERT)比较分类性能评估的关键见解。这是首次将先进的预训练监督深度学习模型BERT与LSTM、逻辑回归和Sent WordNet等其他情感分析模型进行比较的研究工作。
引用
@article{arxiv.2007.01127,
title = {Bidirectional Encoder Representations from Transformers (BERT): A sentiment analysis odyssey},
author = {Shivaji Alaparthi and Manit Mishra},
journal= {arXiv preprint arXiv:2007.01127},
year = {2020}
}
备注
15 pages, 1 table