基于大语言模型的立陶宛在线评论情感分析
计算与语言
2024-07-30 v1 信息检索
机器学习
摘要
情感分析是自然语言处理 (NLP) 中的一个广受关注的领域,由于自动化解决方案的出现而受到广泛关注。尽管如此,该任务仍然具有挑战性,因为语言的内在复杂性和情感的主观性。即使是对于不够研究和资源有限的语言(如立陶宛语)也更具挑战性。我们的研究发现,现有的立陶宛语 NLP 研究表明,传统机器学习方法和分类算法对该任务效果有限。本文我们针对来自多个领域的立陶宛五星在线评论进行情感分析,我们收集并清理了数据。我们首次将变换模型应用于此任务,探索预训练多语言大语言模型 (LLM) 的能力,特别关注微调 BERT 和 T5 模型。鉴于该任务固有的困难,经过微调的模型表现相当不错,尤其是当情感本身较不模糊时:最流行的单星和五星评论的测试识别准确率分别为 80.74% 和 89.61%。它们显著优于当前商业上通用的最先进的大语言模型 GPT-4。我们公开分享了我们的微调 LLM。
引用
@article{arxiv.2407.19914,
title = {Sentiment Analysis of Lithuanian Online Reviews Using Large Language Models},
author = {Brigita Vileikytė and Mantas Lukoševičius and Lukas Stankevičius},
journal= {arXiv preprint arXiv:2407.19914},
year = {2024}
}
备注
Accepted at the 29th International Conference on Information Society and University Studies (IVUS 2024)