扩展越南情感词net以提高越南情感分析模型性能
计算与语言
2025-01-16 v1
摘要
情感分析是自然语言处理(NLP)中最关键的任务之一,涉及训练机器学习模型以基于意见极性对文本进行分类。预训练语言模型(PLMs)可以通过微调应用于下游任务,从而无需从头训练模型。具体而言,预训练语言模型被用于情感分析,这一过程涉及检测、分析和提取文本情感极性。为解决这一任务,已提出许多模型,其中基于RoBERTa优化的PhoBERT-V2模型在越南语中成为最先进的语言模型。PhoBERT-V2预训练方法基于RoBERTa,对BERT预训练方法进行优化,以获得更稳健的性能。本文提出了一种新方法,将PhoBERT-V2与SentiWordnet结合用于越南评论的情感分析。我们提出的模型针对越南语使用PhoBERT-V2,为越南语语境下最突出的BERT模型提供了稳健的优化,同时利用SentiWordnet——一个专为支持情感分类应用而设计的词汇资源。实验结果表明,在VLSP 2016和AIVIVN 2019数据集上,我们的情感分析系统与其他模型相比取得了优异的性能。
引用
@article{arxiv.2501.08758,
title = {Expanding Vietnamese SentiWordNet to Improve Performance of Vietnamese Sentiment Analysis Models},
author = {Hong-Viet Tran and Van-Tan Bui and Lam-Quan Tran},
journal= {arXiv preprint arXiv:2501.08758},
year = {2025}
}