利用多语言情感词典实现低资源语言的零样本情感分析
计算与语言
2024-02-06 v1
摘要
由于低资源语言中缺乏大规模数据,提高多语言语言模型在这些语言中的能力通常很困难。在本文中,我们通过在预训练中使用多语言词典来减少对低资源语言文本的依赖,从而增强多语言能力。具体而言,我们专注于跨越 34 种语言的零样本情感分析任务,包括 6 种高/中资源语言、25 种低资源语言和 3 个代码切换数据集。我们证明,使用多语言词典进行预训练(不使用任何句子级情感数据),相比在英语情感数据集上微调的模型以及 GPT--3.5、BLOOMZ 和 XGLM 等大型语言模型,实现了更优越的零样本性能。这些发现在未见过的低资源语言以及涉及高资源语言的代码混合场景中均可观察到。
引用
@article{arxiv.2402.02113,
title = {Zero-shot Sentiment Analysis in Low-Resource Languages Using a Multilingual Sentiment Lexicon},
author = {Fajri Koto and Tilman Beck and Zeerak Talat and Iryna Gurevych and Timothy Baldwin},
journal= {arXiv preprint arXiv:2402.02113},
year = {2024}
}
备注
Accepted at EACL 2024