低资源和中等资源语言的情感分类
计算与语言
2024-11-11 v2 人工智能
机器学习
摘要
能够分析全球各地人们的情感状态非常重要。全球有 7100 多种活跃语言,为每种语言构建情感分类器是一项劳动密集型工作。特别是对于低资源和濒危语言,构建情感分类器可能相当具有挑战性。我们提出了一种跨语言情感分类器,其中我们使用资源丰富的语言(即我们工作中的\textit{英语})训练情感分类器,并将学习迁移到低资源和中等资源语言。我们比较并对比了两种从高资源语言到低资源或中等资源语言的迁移学习方法。一种方法是将高资源语言的标注投影到平行语料库中的低资源和中等资源语言,另一种方法是直接从高资源语言迁移到其他语言。我们在 6 种语言上展示了我们方法的有效性:波斯语、阿拉伯语、西班牙语、伊洛卡诺语、奥里亚语和阿塞拜疆语。我们的结果表明,我们的方法优于随机基线,并成功实现了跨语言的情感迁移。对于所有语言,直接跨语言情感迁移产生了更好的结果。我们还为四种语言创建了带标注的情感标记资源:波斯语、阿塞拜疆语、伊洛卡诺语和奥里亚语。
引用
@article{arxiv.2402.18424,
title = {Emotion Classification in Low and Moderate Resource Languages},
author = {Shabnam Tafreshi and Shubham Vatsal and Mona Diab},
journal= {arXiv preprint arXiv:2402.18424},
year = {2024}
}