中文

波斯语-英语码混文本的情感分析

计算与语言 2021-02-26 v1

摘要

互联网数据的快速产生,以及从商业和研究角度理解用户情感的需求,促使了大量自动单语情感检测系统的出现。然而,近来由于社交媒体数据的非结构化性质,我们观察到更多多语言和码混文本的实例。这种内容类型的发展对码混情感分析系统产生了新的需求。在本研究中,我们收集、标注并由此创建了一个波斯语-英语码混推文数据集。随后我们提出一个模型,该模型使用BERT预训练嵌入以及翻译模型来自动学习这些推文的极性分数。我们的模型优于使用朴素贝叶斯和随机森林方法的基线模型。

关键词

引用

@article{arxiv.2102.12700,
  title  = {Sentiment Analysis of Persian-English Code-mixed Texts},
  author = {Nazanin Sabri and Ali Edalat and Behnam Bahrak},
  journal= {arXiv preprint arXiv:2102.12700},
  year   = {2021}
}