面向语码混合数据的无监督情感分析
计算与语言
2021-07-13 v1 人工智能
摘要
语码混合是指在两种或多种语言之间交替使用的做法。这种现象多见于多语社会,其出现频率与重要性均在上升。情感分析研究大多为单语,且多数在语码混合文本上表现不佳。本工作中,我们引入利用多种多语与跨语嵌入的方法,以高效地将单语文本中的知识迁移至语码混合文本,用于语码混合文本的情感分析。我们的方法可通过零样本学习处理语码混合文本。我们的方法在英语-西班牙语语码混合情感分析上以绝对 3% 的 F1 分数超越当前最优(state-of-the-art)。在零样本设置下,我们于同一基准上分别取得 0.58 F1 分数(无平行语料)与 0.62 F1 分数(有平行语料),而监督设置为 0.68 F1 分数。我们的代码已公开。
引用
@article{arxiv.2001.11384,
title = {Unsupervised Sentiment Analysis for Code-mixed Data},
author = {Siddharth Yadav and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2001.11384},
year = {2021}
}