印尼电商评论情感分析中LightGBM与BiLSTM的基准测试
计算与语言
2026-05-05 v1
摘要
本研究提出了对自然语言处理 (NLP) 中两种主要方法的比较分析:一种是利用 PyCaret AutoML 框架的机器学习 (ML),另一种是深度学习 (DL)。评估在情感分析任务上进行,使用来自 Hugging Face 的印尼电商评论数据集。数据集包含15,000个样本,分为训练、验证和测试集。ML 实验比较了 LightGBM、Logistic Regression 和支持向量机 (SVM) 算法,而 DL 实验则实现了双向长短期记忆 (BiLSTM) 架构。实验结果表明,BiLSTM 模型在准确率达到98.87%和F1分数达到98.87%时优于所有 ML 模型。而 LightGBM 则以98.23%的准确率在高效训练时间内表现为最佳 ML 模型。这项研究证明了 BiLSTM 架构在捕获印尼评论文本的序列上下文方面的强大能力,使其在这一特定分类任务中表现最佳。
引用
@article{arxiv.2605.01322,
title = {Benchmarking LightGBM and BiLSTM for Sentiment Analysis on Indonesian E-Commerce Reviews},
author = {Lidia Natasyah Marpaung and Vania Claresta and Iqfina Haula Halika and Luluk Muthoharoh and Ardika Satria and Martin Clinton Tosima Manullang},
journal= {arXiv preprint arXiv:2605.01322},
year = {2026}
}
备注
9 pages, 3 figures, 2 tables. The paper compares LightGBM, Logistic Regression, and linear SVM against a BiLSTM model for Indonesian e-commerce sentiment analysis using a 15,000-sample dataset from Hugging Face