用于印尼语移动应用评论情感分析的 BERT 微调
计算与语言
2021-11-05 v1 机器学习
摘要
用户评论在已开发移动应用的成功中起着至关重要的作用。文本形式的用户评论是非结构化数据,在用于情感分析处理时产生很高的复杂度。以往使用的方法常忽略评论的上下文。此外,相对较小的数据导致模型过拟合。一种新方法 BERT 作为迁移学习模型被提出,其预训练模型此前已训练以具备更好的上下文表示。本研究考察了使用两种不同预训练模型微调 BERT 进行情感分析的有效性。除多语言预训练模型外,我们还使用了仅在印尼语上训练过的预训练模型。所用数据集为 2020 年 Google Play 站点上十大最佳应用的印尼语用户评论。我们还进行了超参数调优以寻找最优训练模型。还测试了两种训练数据标注方法以确定模型有效性,即基于评分和基于词典的方法。实验结果表明,在基于词典的数据上,以印尼语训练的预训练模型具有更好的平均准确率。该印尼语预训练模型的最高准确率为 84%,训练轮数为 25,训练时间为 24 分钟。这些结果优于所有机器学习与多语言预训练模型。
引用
@article{arxiv.2107.06802,
title = {BERT Fine-Tuning for Sentiment Analysis on Indonesian Mobile Apps Reviews},
author = {Kuncahyo Setyo Nugroho and Anantha Yullian Sukmadewa and Haftittah Wuswilahaken DW and Fitra Abdurrachman Bachtiar and Novanto Yudistira},
journal= {arXiv preprint arXiv:2107.06802},
year = {2021}
}